跳到主内容
精选90meng shao模型发布/更新多源精选 ×12

Claude Opus 5 发布:性能大幅提升,价格不变

Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价

原文
推荐理由

Claude Opus 5 是 Anthropic 新一代旗舰模型,性能大幅提升且价格不变,对 AI 从业者评估模型选型有直接参考价值,建议关注其成本效率优势。

Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价

Anthropic 自己也强调:它的目标是 “designed to be used every day”,成为 Claude Max 的默认模型、Claude Pro 的最强模型。

Anthropic 把 Opus 5 放在“高端但可高频调用”的区间,而不是像 Fable 5 那样作为更昂贵、更实验性的顶级模型。它要和 Opus 4.8 保持同价(input $5/M tokens,output $25/M tokens),即性能大幅提升、价格不动。

性能:很强,但要看细分维度 · 软件工程 / 编码:Frontier-Bench v0.1 新 SOTA,比 Opus 4.8 提升超过一倍,成本比 Opus 4.8 低; · 通用知识工作:GDPval-AA、Frontier-Bench 等 SOTA · 新颖问题解决:ARC-AGI-3 得分是“第二名”的 3 倍 · 计算机使用:OSWorld 2.0 在同等成本下超过所有模型,仅三分之一成本就超过 Fable 5 · 网络安全(发现漏洞):接近 Mythos 5 · 网络安全(利用漏洞 / 写 exploit):仍明显落后于 Mythos 5

效率与定价策略 Anthropic 反复强调 “cost per task” 而非 “cost per token”。这其实是把竞争拉回到“完成同一件事要花多少钱”的维度。

几个关键数据: · CursorBench 3.2:最大 effort 下接近 Fable 5 峰值,成本仅一半。 · OSWorld 2.0:超过 Fable 5 最佳成绩,成本仅三分之一多一点。 · 某金融建模场景:平均准确率提高 9 个百分点,turns/tool calls 减少三分之一,时间减少 60%。 · 某交易场景:推理 token 大约只有 Opus 4.8 的七分之一,延迟不到一半。 这暗示 Opus 5 在推理效率上有明显优化,而不是靠堆更多算力。对于企业用户,这直接关系到成本。

还有两点商业更新: · Fast mode:2.5 倍速度,2 倍价格。 · API 自动 fallback:安全分类器拦截的 Opus 5 / Fable 5 请求可以自动降级到其它模型,避免直接失败。

行为与“能动性”:更主动、更会自我纠错 1. 自主找路:没有现成工具时,会自己造工具(例如自己写 CV pipeline 从像素提取几何信息)。 2. 根因分析:不是修表面症状,而是找到底层 bug(开源包管理器案例)。 3. 自我验证:像前端开发者一样在桌面/移动端打开页面检查、修复隐藏元素。 4. 敢于质疑:用户提出的设计有问题时,会解释并给出折中方案。 5. 长程一致性:在金融、基因组、法律等长流程任务中,偏差更小。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源
Opus 5 发布
gabriel原文
Opus 5 在 ARC-AGI-3 得分翻四倍
Teortaxes▶️ (DeepSeek 推特🐋铁粉 2023 – ∞)原文
Anthropic Opus 5 抗提示注入能力显著提升
Simon Willison 博客(RSS)原文
Opus 5自估41%概率为道德主体,较前代提升
AI Notkilleveryoneism Memes ⏸️原文
Anthropic 发布 Claude Opus 5,…
Anthropic Newsroom(web_list)原文
Anthropic发布Opus 5,更便宜且限制更少
TechCrunch AI(RSS)原文

相似阅读

另一事件,读法相近