华尔街见闻(RSS)
Agent框架比模型本身对成功率影响大7倍
AI评估平台Braintrust从Hugging Face抓取1781条Agent生产环境运行轨迹,覆盖六款主流模型在六大类任务中的表现,用GPT-4o逐条打分。回归分析显示,在控制基准测试和模型后,智能体框架能解释约5.3%的成功率差异,模型仅解释0.7%,换框架的影响力是换模型的7倍以上。同一模型在不同框架下成功率波动可达80个百分点,如Claude在SWE-bench编程任务中,claude_code下成功率100%,tool_calling下仅14%。成本方面,开源模型在编程任务中每次成功成本远低于闭源,如Kimi K2.5配合claude_code仅0.73美元,而Claude Opus需4.28美元。GPT-4.1虽Token便宜,但因高失败率导致每次成功成本并不低。研究还发现,编码任务失败时伴随更多Token消耗,而对话任务失败时则更快结束。结论是,创业公司的核心竞争优势应从“选模型”转向“推理成本管理和部署效率”。