GPT-6.1 Sol评测:性价比追平Astra,安全能力有差距
muse 做的,耗时 10 秒:
推荐理由
结构清晰,用具体数据对比了不同模型在代码、安全和准确率上的表现,为创作者提供了详实的参考素材。
muse 做的,耗时 10 秒:
GPT-6.1 Sol(今早监测简报里提过的那款),官方刚放出完整评测数据。
核心结论:
- 性价比是最大卖点:API 价格是旗舰 Astra 的 1/5(输入 $2 / 输出 $10 每百万 token),但官方自测里代码工程(DeepSWE)直接追平 Astra
- 第三方验证也过硬:Artificial Analysis 智能指数 52 分,只比 Astra(53)低 1 分,比上一代 Sol(48)高出 4 分
- 短板在安全类:SEC-Bench Pro 78.8% vs Astra 85.4%,ExploitGym 35.1% vs 42.4%,差距还比较明显
- 更准了:低推理强度下事实错误率从旧 Sol 的 11.4% 降到 7.7%
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力