跳到主内容
@wquguru
精选80Hugging Face 每日论文(json_list)论文研究

AstroPT揭示概念涌现顺序,为LLM可解释性提供校准基准

What AstroPT knows about galaxies, and what that can teach us about LLMs

原文
发到 X

可解释性研究日益关注概念在训练过程中何时出现,以及线性探针能否恢复真实结构,但在语言模型中,这些主张难以验证,因为语言几乎不提供概念间或概念与关系之间的真实排序。我们提议通过AstroPT——一个在数百万张星系图像上训练的Transformer——利用天文学的真实基准作为校准测试平台。AstroPT是一个类似LLM的模型,在其训练领域内,概念的难度排序及它们之间的关系是预先已知的。通过探测不同检查点、层、模型规模和目标选择下的冻结表示,我们发现星系属性以固定顺序出现,该顺序与其已知难度相符——几乎直接编码在像素中的量(如波段星等)在训练早期及网络浅层即可解码,而基于多波段/光谱及推断的量(如红移和特定恒星形成率)则出现得更晚且位于更深层。这一顺序在我们测试的训练目标下保持不变,并随容量增加在幅度上扩展但顺序不变。我们的线性探针方向进一步恢复了星系属性间已知的物理结构。我们的发现表明,天文学为校准我们通常盲目应用于LLM的机制可解释性方法提供了一个受控的沙盒环境。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近