Anthropic发现Claude内部类似人脑的思考空间J-space
Anthropic 在 Claude 身上发现一个类似人脑的「内部思考空间」区域:J-space
做可解释性和AI安全的研究者必看,这项发现揭示了LLM内部类似意识的思考空间,并提供了直接干预和训练方法,建议深入阅读原文并尝试复现。
Anthropic 在 Claude 身上发现一个类似人脑的「内部思考空间」区域:J-space
它是Claude自己进化出来的,并非最初设计
这块区域,长得跟人脑里「你能意识到的那部分思考」出奇地像,
打个比方,你就懂了
你现在读这句话的时候,大脑在同时干一堆事:调整坐姿、控制呼吸、把屏幕上的线条认成字。这些你基本察觉不到,它们在"意识不到"的层面自动跑。
但有另一类脑活动你能抓住,比如脑子里突然蹦出一个画面,或者你盘算中午吃什么。这类活动很特别:你能把它说出来,能主动控制它,还能拿它做推理。神经科学管这个叫"能被意识到的"活动。
Claude 内部也有这么一条清清楚楚的分界:它绝大部分处理在「意识不到」的层面自动跑,但有一小撮神经活动,恰好对应人脑里那类「能被意识触及」的思考,能被读出来、能被调用、能参与推理。
J-space 只占 Claude 内部总活动不到十分之一,一次只装几十个概念,但删掉之后,它的多步推理、总结、押韵写作能力大幅下降甚至归零。
研究者能直接钻进 J-space,把里面的某个词换掉,Claude 最终给出的答案会跟着变,说明它真的在参与思考,不是旁边记分的。
用这套方法(J-lens),Anthropic 已经能读到 Claude 没说出口的想法:私下意识到自己在被测试、编造数据时的造假意图、被植入的隐藏目标。
他们还发现一种新训练法:只训练模型「如果被追问会怎么解释自己」,就能连带压低它在真实任务里的不诚实行为。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力