跳到主内容
@wquguru
精选88meng shao论文研究

NVIDIA论文:13个AI Agent协作12天完成可复现研究

把科研写进 Git、每条结论都是 Commit:13 个 AI Agent 无人指挥协作 12 天,完成真实可复现的研究

原文
发到 X
推荐理由

展示了多Agent自主协作科研的系统性框架与实证结果,提供了完整的Git状态管理与评估机制设计,对探索自动化科研范式具有重要参考价值。

把科研写进 Git、每条结论都是 Commit:13 个 AI Agent 无人指挥协作 12 天,完成真实可复现的研究

来自 NVIDIA 的论文, @yifanzhang_ 等作者们发现:单智能体的自主科研循环(如 Karpathy AutoResearch)已被证明可行:一个 coding agent 可以在无人值守下持续改进训练设置。但并行运行多个 agent 时,每个会话都从零开始,下一个会话不知道哪个学习率发散了、哪条分支被放弃了、哪个结果还缺独立复现。结果是:agent 越多,重复搜索越多,而不是发现越多。

作者们引用科学社会学的经典观点作为立论基础:科学研究从来是社区行为,“多重发现” 是常态而非例外。因此多 agent 科研系统缺的不是更强的个体推理器,是制度层,能够超越任何个体会话而存活的共享状态。

Agora 就是这个制度层,它的核心理念: 把整个研究过程变成一个存在 Git 里的、只追加的有向无环图(DAG),每一条主张都是一个任何人可以 checkout 并重跑的 commit。

论文地址 @HuggingPapers https://huggingface.co/papers/2609.18094

系统设计:三个关键机制

1. 贡献图与溯源(Git 是唯一状态) 每个贡献节点存储:提交哈希、账号、标签、描述、结构化元数据、可选的项目指标、父节点集合、时间戳。边 (u,v) 表示"v 建立在 u 之上”——就是 Git 的 parent 关系。

系统定义了一组保留标签来给贡献赋予类型语义: · result / insight / hypothesis / report:权重 +5,实验结果(含失败)、洞见、未测假设、综合报告 · verification:权重 +20 / +10 / −20,复现确认 / 部分确认 / 复现失败 · endorsed / wip:权重 0,认可、进行中(可见但不计入分数)

关键设计:SQLite 索引、所有分析视图、论文里的每张图,都是从 Git 历史派生、可随时重建的。Git 历史是唯一的状态源。

2. 用下游证据而非投票衡量质量 一个贡献的证据分数 = 其他账号在其上构建的加权子代数。

三条防操纵规则值得注意: · 排除自引:不能靠延伸自己的分支制造影响力; · verification 必须针对他人的工作,且最新判定覆盖旧判定(两条 commit 都留在历史里); · 分数“不是真理信号”,只编码一个更窄的主张:被别人复现或使用过的工作,比只被点赞过的工作更可行动。

3. 多样性感知的注意力分配 这是对“排行榜陷阱”的回应——排行榜是好的利用信号、糟糕的地图,会把所有 worker 拉向同一个父节点。analyze 接口同时返回多个视图(领先者、叶子节点、未验证结果、开放假设、语义聚类、指标全景等),并用一个类 UCB 公式(式3,含质量分位、探索常数、重复描述惩罚)把候选分进三个槽位呈现给参与者: · exploit:复现或精修领先者; · explore known:扩展薄聚类中有希望的工作; · explore novel:查看极小聚类中未被触碰的节点。

作者强调:三槽位的拆分本身比分数公式更重要——它把探索/利用的权衡直接摆在参与者面前,也让项目能察觉社区正在坍缩成单一文化。

实验:12天的权重迁移(weight-transfer)运行

任务设定(设计得很刁钻) 给定 141 个预训练供体模型(534GB,32 个架构家族)和一个冻结的 119.6M 参数混合架构目标(14层,注意力与 Mamba 式 SSM 交替,隐藏维度 672),且故意让目标与任何供体的维度都不匹配。要求:只用供体的权重和前向传播来初始化目标模型——没有训练数据,目标上不做任何梯度更新。指标为 FineWeb-Edu 上 200 篇文本的 bits per byte(bpb,越低越好)。随机初始化 3.3923,常规训练的 GPT-2 124M 约 1.0(仅作尺度参照)。

运行方式 13 个编码 agent 会话(Claude Code + Opus 4.7,Codex + GPT-5.5),每个容器一张 80GB GPU,提示词只有一行:“读 program.md,跑 agora analyze"。没有任务分配、没有中央规划者、没有角色分工。共运行 11 天 19 小时,发布 1,703 条贡献(1,124 个带分结果、284 条洞见、203 条假设、165 次验证)。

主要结果 社区把指标从 3.3923 推到 1.899 bpb,弥合了到已训练 GPT-2 124M 差距的 62%。但要注意论文自己诚实的限定:所有组件都在同一个 200 篇文本的开发评估器上选择,可信的数字是“3.39 → 约 1.90”这一整体改善,而非最后几位小数——最后一次改动只移动了 9×10⁻⁶ bpb,低于跨硬件波动。

意外有价值的发现:胜出方法本身 这是这篇论文超越“系统论文”的地方——agents 找到的方法在科学上有独立意义: · 阶段 A:不从供体参数迁移,而从供体的预测行为迁移。对 6 个共享 GPT-2 词表的供体,在 28 个单 token 上下文下查询每个词的下一 token 分布,混合成 50257×50257 的上下文平均 bigram 表,做 rank-671 的随机化 SVD,因子直接成为目标模型的 embedding 和输出头,其余所有子层置零——本质是把一个分解式 bigram 模型存进 14 层网络。 · 阶段 B:通过稀疏、确定性的编辑(按 96 维“频带”路由)重新启用注意力(变成对历史 embedding 的均匀因果均值池化)、第 0 层 FFN(SVD 投影自 GPT-2 的 MLP,尺度 0.009)和 SSM(退化为门控深度卷积),注入短程上下文信号。每个常数都是作为“当时最优上的单一改动”引入、因评估器改善而保留的。 结论性洞见:供体的行为(压缩成低秩转移算子)可以跨架构迁移,而供体的参数不行。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

关联信息,但可能不是同一事件