跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

FrontierChallenge:评估科学智能体端到端工作流完成度

FrontierChallenge: Evaluating Scientific Workflow Completion

原文
发到 X

科学智能体日益频繁地分析数据、执行代码并生成研究产物,然而大多数基准测试仍侧重于最终答案、孤立程序或单一领域。我们推出FrontierChallenge,这是一个包含300个端到端科学工作流的跨领域基准测试。在本文中,我们发布并评估了其中97项任务,涵盖量子化学、分子动力学、材料表征、分析化学、生命科学以及电化学/环境领域。每项任务提供固定输入,并指定一组必需的科学交付物。我们使用三种智能体脚手架评估了十二个前沿模型。通过率衡量满足完全完成标准的任务比例,而平均得分则反映部分进展。表现最佳的配置组合也仅完成了97项已发布任务中的20项,通过率为20.6%。在分析化学和电化学/环境领域,部分进展转化为完整交付的效果尤其不佳:平均得分分别达到87.6和94.9,但最高通过率仅为4%和0%。在未通过的Claude Code轨迹中,仍有75.5%以声称完成的语言结束。这些发现表明,无论是高分部分得分还是自信的完成声明,都不能可靠地表明科学任务已完全交付,凸显了将端到端工作流执行与科学交付物完整性共同评估的必要性。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近