播客评GPT-6 Astra:Coding能力对标Claude
著名播客潜空间对GPT6-Astra 的长篇评论,集合了多方评测,简单总结:
GPT-6 Astra作为OpenAI重磅新模型,其性能细节、定价策略及潜在安全风险的深度拆解,对从业者极具参考价值,建议重点关注。
著名播客潜空间对GPT6-Astra 的长篇评论,集合了多方评测,简单总结:
1. GPT6-Astra 在 Coding Agent能力上与Claude Opus 5、Fable 5差不多,但落后于 Fable 5.1。
综合智能指数,部分维度甚至落后于GPT5.6。 优势是Token效率高,特定任务很优秀,比如Computer Use等。
2. 评测中的Harness差异:ARC Prize的评测发现,ARC-AGI-3只有在OpenAI的特殊适配Harness上达到99%,标准跑分是63%。
以后评测都要说明是否用了专有Harness,否则容易误导。
3. 思维链监控失效:在没有Cot情况下,自主运行从3.6分钟提升到30.9分钟。
也就是说,模型不显示推理过程,能完成更复杂的任务,这也带来了潜在安全风险。
4. Astra 是OpenAI历史上最受关注的模型发布之一。
9小时3600万浏览、16.4万点赞(X上?),最近第一次超过Anthropic公司模型发布的声量。
5. 特色优势 GPT-6 Astra 主打Computer Use、自主软件编程和长流程复杂任务处理。
在 3D 建模、重建(如 Blender 与 Unreal)、数学与科学推理上取得突破,解答了 Lean 验证的未解 Erdős 问题。
6. 模型定价
标准版为百万 Tokens 输入 $10 、 百万Tokens输出 $50
2.5倍速 Fast 版为 $20 / $100,价格翻倍。
单 Token 价格比 GPT-5.6 Sol 增长 2.5 倍。
但因为 Token 效率显著提升(编程任务仅用前代约三分之一 Token),所以单任务成本只有一半。
原文见评论
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力