跳到主内容
@wquguru
精选88向阳乔木模型发布/更新多源精选 ×14

播客评GPT-6 Astra:Coding能力对标Claude

著名播客潜空间对GPT6-Astra 的长篇评论,集合了多方评测,简单总结:

原文
发到 X
推荐理由

GPT-6 Astra作为OpenAI重磅新模型,其性能细节、定价策略及潜在安全风险的深度拆解,对从业者极具参考价值,建议重点关注。

著名播客潜空间对GPT6-Astra 的长篇评论,集合了多方评测,简单总结:

1. GPT6-Astra 在 Coding Agent能力上与Claude Opus 5、Fable 5差不多,但落后于 Fable 5.1。

综合智能指数,部分维度甚至落后于GPT5.6。 优势是Token效率高,特定任务很优秀,比如Computer Use等。

2. 评测中的Harness差异:ARC Prize的评测发现,ARC-AGI-3只有在OpenAI的特殊适配Harness上达到99%,标准跑分是63%。

以后评测都要说明是否用了专有Harness,否则容易误导。

3. 思维链监控失效:在没有Cot情况下,自主运行从3.6分钟提升到30.9分钟。

也就是说,模型不显示推理过程,能完成更复杂的任务,这也带来了潜在安全风险。

4. Astra 是OpenAI历史上最受关注的模型发布之一。

9小时3600万浏览、16.4万点赞(X上?),最近第一次超过Anthropic公司模型发布的声量。

5. 特色优势 GPT-6 Astra 主打Computer Use、自主软件编程和长流程复杂任务处理。

在 3D 建模、重建(如 Blender 与 Unreal)、数学与科学推理上取得突破,解答了 Lean 验证的未解 Erdős 问题。

6. 模型定价

标准版为百万 Tokens 输入 $10 、 百万Tokens输出 $50

2.5倍速 Fast 版为 $20 / $100,价格翻倍。

单 Token 价格比 GPT-5.6 Sol 增长 2.5 倍。

但因为 Token 效率显著提升(编程任务仅用前代约三分之一 Token),所以单任务成本只有一半。

原文见评论

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源
OpenAI发布Astra模型获好评
Teortaxes▶️ (DeepSeek 推特🐋铁粉 2023 – ∞)原文
OpenAI发布GPT-6 Astra
Hacker News Best(web_list)原文
OpenAI发布GPT-6 Astra:ARC-AGI得分99.9%
Simon Willison 博客(RSS)原文

相似阅读

另一事件,读法相近