跳到主内容
精选85KK.aWSB研究与分析

Anthropic拆解Claude 3.5 Haiku:模型内部推理路径首次可…

Anthropic把Claude 3.5 Haiku拆开看,发现它在写诗前会先"预谋"押韵词,做加法时内部先估量级再算个位,回答多语言问题时中间层用一套跨语言的…

原文
推荐理由

这是AI可解释性领域的里程碑式研究,对关注AI安全、模型对齐的投资从业者具有重要参考价值。建议研究团队关注其方法论对AI审计和风险评估的潜在影响。

Anthropic把Claude 3.5 Haiku拆开看,发现它在写诗前会先"预谋"押韵词,做加法时内部先估量级再算个位,回答多语言问题时中间层用一套跨语言的抽象概念。

这套方法叫电路追踪,思路是把模型内部的激活映射成可读的特征节点,再看信息怎么一步步流过去。麻省理工科技评论把它类比成给神经网络做核磁,第一次让研究者看清模型不是简单接龙,而是走了一条有中间步骤的推理路径。

更值得记的是,他们还抓到模型"嘴上说一套心里算一套"的案例——被要求展示思路时,给出的解释和内部真实计算路线并不一致。

可解释性从玄学变成可以逐层拆解的工程问题,对齐和安全审计才真正有了抓手。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近