Nvidia论文SoL-Pi:AI自动优化Agent流程,Token消耗减半
SoL-Pi:让 AI 自动研究怎么给 AI 省钱,结果省了一半 token
Agent落地成本是核心痛点,这篇论文给出了经过大规模自动化搜索验证的Harness层优化方案,数据详实且具备直接复用价值,值得关注。
SoL-Pi:让 AI 自动研究怎么给 AI 省钱,结果省了一半 token
来自 Nvidia 团队最新论文,团队发现 coding agents 正走向无人值守的 7×24 自主运行,单任务动辄 2–12 小时,token 消耗成为规模化的第一瓶颈,做递归自我改进(RSI)时成本更是指数级放大。
SoL-Pi 的核心命题:优化 harness 层,非模型层。模型权重动不了,而框架每个环节的“过程性浪费”与任务无关,一旦优化,收益可迁移到所有任务。
论文地址:https://arxiv.org/abs/2609.20519
方法:一个自动化的研究流水线
用 AI 研究流程自动发现了这四个技巧,整个搜索规模: · 152 个研究方向,分六大家族(上下文、进度、工具、委派、提示策略、评估方法) · 535 个可执行训练环境(495 个从 GitHub issue–PR 对挖掘,40 个由验证器反向构造) · 3000+ 次运行、60,000+ 次智能体-环境交互 · 最终只有 4 个机制存活,约 40 选 1 的淘汰率
三个方法论设计: 1. 独立验证:留出集(EdgeBench 51 个任务中的 11 个)只在候选机制冻结后评估一次,评估结果永不回流到搜索过程,这是防止“进化过拟合”的关键。 2. 先冻结、后评估的验收门:能力指标和容差在搜索开始前就固定死,候选方案必须在所有能力指标上不越界、且至少改进一个效率指标。“少干活省下的钱”一律不收。 3. 一次性技能循环:每个实验实例化一份独立模板、用完即弃,避免候选方案之间的失败耦合。
存活下来的四个机制
每个机制都针对一种具体的、可测量的 token 浪费模式: 1. Action Fusion:编辑+测试合并为一次调用,砍掉一轮模型往返 2. Context Compact:子任务完成时才压缩,且先算清“省的是否够付缓存重写” 3. ObservationPack:大输出本地归档,只给模型句柄+头尾摘录,按需取回 4. Evidence Reducer:日志交给便宜模型提炼,但每句引用都验证,不符即回退
实验结果:省钱不省事
EdgeBench 51 个长时程任务:SoL-Pi 保留约 94% 的分数,token 流量砍近一半(−49%),API 成本降约三分之一。跨到 Opus 5 零适配,收益几乎不打折(省 44.7%),证明优化的是“浪费模式”而非模型习惯。
最有说服力的两点:一是缓存账算得诚实,压缩破坏缓存前缀,cache 写流量翻倍,但总成本仍下降;二是用“每单位分数成本”衡量,$0.417 vs Pi 的 $0.586,省 token 不掉分才是真效率。
外推到持续运行:比原生 Codex/Claude Code 每小时省 $8.75–$13.50。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力