跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

超越最终得分:长时程AI研发智能体的系统评估

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

原文
发到 X

自主智能体正日益展现出通过长时间实验来改进模型、系统及其他技术制品的能力。然而,要理解这一能力的当前状态,评估必须超越最终得分,因为最终得分既无法揭示进展是在何处获得或丧失的,也无法表明积累的经验是否改善了后续决策。因此,我们基于一个新框架,对七个前沿模型在36项长时间任务上进行了系统性评估,该框架利用基于规则的指标,通过解决方案构建、执行和反馈控制来刻画运行过程中的行为,并通过受控比较来评估任务内和任务间的经验复用。结果表明,当前的智能体更像工程优化器而非完全自主的研究者:它们能够制定并实施实用的解决方案,但其性能在不同运行间差异显著,它们最强的解决方案主要改编或结合了已有技术,而真正的方法论创新仍然罕见。详细分析揭示,观察到的性能受多种因素影响,包括相似最终结果背后的不同过程瓶颈、可能帮助或误导后续决策的经验复用,以及影响性能稳定性的框架设计。这些发现为改进模型训练、推理时策略、经验管理和框架设计提供了具体方向。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近