跳到主内容
@wquguru
精选80小互模型发布/更新多源精选 ×2

OpenAI 修复 API 设置后 ARC-AGI-3 分数大涨

OpenAI 只打开两个 API 设置

原文
发到 X

OpenAI 只打开两个 API 设置

GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3%

  • OpenAl复盘了一次自家模型「考砸」的经历:同一个 GPT-5.6 Sol、同一套评测题,只把两个 API设置打开,ARC-AGI-3公开题库的分数从13.3% 涨到 38.3%。
  • 问题出在跑模型那套程序(业内叫 harness)上:每走完一步,模型写给自己看的私有思考被整段丢掉,下一步只能从零重新理解这个游戏。
  • 第二个问题是上下文塞满就删掉最早的消息,连过去按了哪些键都在被挤出去,模型等于没有「过去」。
  • 修法就两个开关:用 Responses API 把上一次响应ID 传回去,推理自动留住;再开 compaction,上下文到了阈值就压成一份浓缩摘要接着跑,不删开头。
  • 省钱比涨分更夸张:最高档下每局输出 token 从 290 万降到 49 万;新程序在「高」档就拿到了旧程序拼到「最高」档的同样分数,token 差约12倍。

https://best.xiaohu.ai/article/openai-arc-agi-3-harness/

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近