跳到主内容
@wquguru
精选86Hugging Face 每日论文(json_list)论文研究

ASPIRE基准:大模型能否从模糊目标中自我进化

Aspire: Can Models Self-Evolve from Vague Goals?

原文
发到 X
推荐理由

提出了极具挑战性的模糊目标自我进化场景,揭示了当前Agent在自主规划与泛化上的核心短板,对研究下一代自主智能体具有重要参考价值。

许多重要的人类学习形式始于一个模糊的目标,例如“成为更好的物理学家”或“提升研究能力”。学习者必须解读该目标、识别能力差距、决定如何学习,并判断自己是否真正取得了进步。相比之下,现有关于大语言模型(LLM)自我进化的工作通常以人类指定的任务和评估指标为起点,将自我进化简化为优化显式目标,而非自主决定学什么以及如何学。我们引入了 ASPIRE,这是一个面向模糊目标驱动的自我进化的基准测试。ASPIRE 仅提供自然语言描述的能力目标,而下游评估任务则保持隐藏。智能体必须通过选择数据与更新方法、构建训练与验证信号以及决定何时进行评估,来将该目标具体化。ASPIRE 在一个统一的交互环境中支持模型权重和智能体框架(agent harness)的进化,并在一个由专家编写的、涵盖六个目标的 520 项隐藏评估集上对演化后的系统进行评估。我们的实验表明,模糊目标会将搜索精力重新导向对目标的解读。当前智能体通常能够完成训练和框架编辑循环,但权重层面的提升仍然稀疏且不稳定,最强的演化框架仍不及经过工程设计的 Qwen-Agent 参考基线。智能体经常使用不匹配的数据进行训练,并过度依赖狭窄的自我评估,因此局部收益无法迁移到隐藏评估中,持续的搜索和训练甚至会抹去早期的改进成果。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近