跳到主内容
精选85meng shao模型发布/更新多源精选 ×13

OpenAI GPT-5.6 系列预览发布:Sol/Terra/Luna 三档,引入多Agent协作

OpenAI GPT-5.6 系列模型预览发布

原文
推荐理由

做模型选型和 Agent 系统的同学重点关注:Ultra 模式的多 Agent 协作是实质能力跃迁,Terminal-Bench 2.1 的 SOTA 也值得压测。定价策略清晰,可评估成本效益。

OpenAI GPT-5.6 系列模型预览发布

好消息是 Sol 很强!坏消息是目前只能小范围预览,要配合美国政府监管审查!A 厂求仁得仁,转身拖 O 厂下水,原来 A 厂的 AI 宪法,就是:都别活 😄

· Sol - 旗舰,最强能力 $5 / $30 · Terra - 均衡,日常主力 $2.50 / $15 · Luna - 轻量,最低成本 $1 / $6

Terra 性能与 GPT‑5.5 相当但成本减半;Luna 在最低价位仍保留较强能力。

新能力:从"单 Agent 推理"走向"多 Agent 协作"

两个值得注意的新机制: · Max reasoning effort:给 Sol 更深的推理预算。 · Ultra mode:超越单 Agent,通过 subagents 协同加速复杂任务。

Ultra 模式是本文最实质的能力跃迁信号——它把模型能力从"单个推理体"扩展到"协调多个 subagent 的系统"。在 Terminal‑Bench 2.1(命令行工作流基准)上,Sol Ultra 达到 91.9%,Sol 88.8%,而 Ultra 与非 Ultra 的差距本身说明"subagent 调度"带来了可观增益。

三大领域基准:编码、生物、网络安全的"效率前沿"叙事

OpenAI 反复使用一个框架:性能—效率前沿(performance-efficiency frontier),即不只比分数,更比"达到同等分数需要多少 token"。

· 编码:Terminal‑Bench 2.1 新 SOTA。 · 生物学:GeneBench v1(长程基因组与定量生物学分析),Sol 比 GPT‑5.5 分数更高且 token 更少。 · 网络安全: · ExploitBench:Sol 用约 1/3 的输出 token 即可与 Mythos Preview 竞争。 · ExploitGym(UC Berkeley 联合前沿实验室):三档模型随推理增强,能力同步提升。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源
GPT-5.6系列发布,三款模型亮相
量子位(RSS)原文
OpenAI发布GPT-5.6系列模型,限量开放
华尔街见闻(RSS)原文
求助:谁有GPT-5.6 Sol访问权限?
Przemek Chojecki | PC原文
OpenAI 发布 GPT-5.6 系列:Sol、Terra、Luna
Simon Willison 博客(RSS)原文
OpenAI 预览 GPT-5.6 Sol:下一代模型
OpenAI News(RSS)原文
白宫要求OpenAI推迟发布GPT-5.6
TechCrunch AI(RSS)原文

相似阅读

另一事件,读法相近