StateM 运行时将 Terminal-Bench 2.1 准确率提至
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
做长程 Agent 的同学必看,这套 harness 缩放思路不换模型权重就把准确率拉高十几个点,还附了可迁移的运行手册和开源代码,值得直接拿去复现。
长时程智能体即使其底层模型能够解决各个组成步骤,仍可能失败。它们可能丢失可变状态的跟踪、未能从先前执行中重新激活经验教训、跳过已知流程,或过早停止。我们押注于通过增强执行系统(harness scaling)来改进智能体周围的执行环境,而不改变其模型权重。我们引入StateM,一种以智能体为中心的运行时,围绕持久状态、阶段局部上下文、受检转换、可恢复运行手册以及智能体和用户可共同检查的版本化程序实践来组织执行。 在Terminal-Bench 2.1上,StateM将GPT-5.5 xhigh提升至92.1%,而参考值为83.1%,GPT-5.6 Sol Ultra为91.9%。该运行手册无需修改即可迁移至GPT-5.6。使用GPT-5.6 Sol xhigh,StateM在445次试验中达到95.3%的原始准确率,并在所有89个任务上至少成功一次。冻结配置文件将GPT-5.6 Luna从76.7%提升至85.4%,高于84.9%的Sol xhigh参考值。 使用相同的运行时、运行手册结构和黄金规则,不到38次适配调整将DeepSeek-V4 Flash在标准超时下从82.7%提升至88.1%,在88个任务的公共核心上提升至89.1%。仅扩展剩余的延迟敏感任务即可匹配所报告的88.8% GPT-5.6 Sol最大结果。最终评分API使用量约为15,而GPT参考值为574.68;DeepSeek总支出为52.22。 在BusinessBench上,基于开发集构建的特定领域运行手册在保留集上获得0.55个宏平均和1.34个微平均点的提升;两个机制匹配的领域提升了10.04个点。当任务共享执行结构时,具体规则能够泛化,而控制方法则广泛适用。StateM将选定的事后分析发现转化为持久、可执行的先决条件和实践,通过有状态控制使学到的控制规则显式且可强制执行。代码见github.com/henryqin1997/statem。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力