跳到主内容
@wquguru
精选70Hugging Face 每日论文(json_list)技巧与观点

EarlyEval:通过早期结果预测降低智能体评估成本

EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction

原文
发到 X

评估大语言模型(LLM)智能体对于指导其发展至关重要,然而这一过程已变得昂贵得令人望而却步:前沿模型在智能体基准测试上运行一次的成本可能高达数百至数千美元,且这一费用需在迭代开发周期中反复支付。此前的工作主要围绕基准蒸馏展开,旨在减少评估任务的数量,但保留了每个剩余任务的执行成本。在本研究中,我们引入了早期结果预测(early outcome prediction),这是一种互补的效率优化维度,旨在降低单个任务内的成本。我们的核心洞察在于:智能体的最终结果往往在其执行完成前很久,就已从其中间行为中显现出来。我们将这一理念具体化为 EarlyEval,这是一个轻量级框架,它基于行为、文本和参考解决方案特征训练一对 LightGBM 成功与失败分类器,并在任一分类器达到校准后的置信度阈值时立即终止智能体运行,从而将每步开销降至微乎其微。在 SWE-bench Verified、TerminalBench 和 Toolathlon 三个基准测试中,EarlyEval 能够在保持 89%-97% 预测准确率的同时,消除 13%-26% 的智能体步骤,并减少多达 44.1% 的输入 token 和 29.4% 的输出 token,同时仅使各智能体的解决率平均波动一到两个百分点。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近