跳到主内容
@wquguru
精选85黄小木AI 产品与模型

GPT-6.1 Sol评测:性价比追平Astra,安全能力有差距

muse 做的,耗时 10 秒:

原文
发到 X
推荐理由

结构清晰,用具体数据对比了不同模型在代码、安全和准确率上的表现,为创作者提供了详实的参考素材。

muse 做的,耗时 10 秒:

GPT-6.1 Sol(今早监测简报里提过的那款),官方刚放出完整评测数据。

核心结论:

  • 性价比是最大卖点:API 价格是旗舰 Astra 的 1/5(输入 $2 / 输出 $10 每百万 token),但官方自测里代码工程(DeepSWE)直接追平 Astra
  • 第三方验证也过硬:Artificial Analysis 智能指数 52 分,只比 Astra(53)低 1 分,比上一代 Sol(48)高出 4 分
  • 短板在安全类:SEC-Bench Pro 78.8% vs Astra 85.4%,ExploitGym 35.1% vs 42.4%,差距还比较明显
  • 更准了:低推理强度下事实错误率从旧 Sol 的 11.4% 降到 7.7%

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

关联信息,但可能不是同一事件