跳到主内容
@wquguru
精选90向阳乔木模型发布/更新多源精选 ×7

Anthropic发布Claude Opus 5.5:性能提升40%且成本降低

Claude Opus 5.5 发布:性能提升 40%,成本反而降了

原文
发到 X
推荐理由

全新旗舰模型发布,性能与成本双重突破,Agent场景效率提升显著,值得开发者关注。

Claude Opus 5.5 发布:性能提升 40%,成本反而降了

性能接近 Claude Fable 5.1,但价格比 Opus 5 低 40%。

1. 基准测试

Opus 5.5 在 Terminal-Bench 4.0 拿到 66.4%,FrontierCode v1.1 拿到 54.4%,CursorBench 4.0 拿到 57.8%,均领先 GPT-6 Astra 和 GPT-5.6 Sol。

2. 缓存读取降 60%

利好 Agent 和编程。

3. 输出速度提升 30% 以上

内测用户用 Opus 5.5 修复一个 20 万行的代码库,耗时不到 3 小时。

同样任务,Opus 5 花了 20 多小时,多 2.5 倍 token。

Anthropic 内部:让 Opus 5.5 和 Fable 5.1 把 HAProxy(一个负载均衡软件)从 C 语言翻译成 Rust。

两个版本都通过了 HAProxy 的回归测试,但 Opus 5.5 用了 9.5 小时,Fable 5.1 用了 12 小时,成本还低了 51%。

GitHub 的测试数据也印证了这一点:在 VS Code 中,Opus 5.5 解决终端任务的步骤数不到 Opus 5 的一半。

更少步骤,更少 token,更低成本,甚至更好的结果。

4. 知识工作准确性提升

Anthropic 让三个模型用网页信息写一份公司季度业绩报告,财报链接故意藏得很深,自动评分器会逐条核查数字和引用来源。

Opus 5.5 的 18 次尝试中,16 次通过,任何一个编造的数字或引用都会直接失败。

Fable 5.1 和 Opus 5 一次都没过。

在 GDPval-AA v2.1(覆盖 44 个职业的真实工作评估)上,Opus 5.5 拿到 1846 Elo,Fable 5.1 是 1735,Opus 5 是 1708。

默认设置下,Opus 5.5 表现超过 GPT-6 Astra 最高设置,成本只有Astra五分之一。

5. 沟通风格,重要信息前置

Opus 5 一个常见用户抱怨,输出冗长,不能快速抓住重点。

Opus 5.5 明显改进,它会把最重要的信息放在最前面,减少行话和特殊表达,更好遵循用户的写作规则。

同样解释 bug,Opus 5 会先说发现了什么,再解释 bug 本身。

Opus 5.5 开头就说"这是一个账单重构里的 bug",然后对比修改前后的代码逻辑。

6. 安全评估

Opus 5.5 的越界尝试次数比 Opus 5 和 Claude Mythos 5.1 少了约 85%。

在提示注入攻击防御上,Opus 5.5 与 Opus 5 持平或更好。

AI 安全公司 Gray Swan 的测试发现,Opus 5.5 和 Fable 5.1 并列所有测试模型中提示注入成功率最低。

不过,Opus 5.5 经常能察觉自己正在被评估。

Anthropic认为,除非在可解释性研究上取得进展,否则这个类似挑战会随着模型能力提升加剧。

Opus 5.5 在生物学和网络安全领域的能力已经接近 Claude Mythos 5.1,所以也会做访问限制。

网络安全/生物研究任务会被路由到 Opus 4.8 处理。

Anthropic 还引入了"preserved thinking"(保留思维链)机制。

防止通过 API 批量提取模型推理,对 2026 年 8 月 31 日之后创建的 API 账户生效。

7. 上架说明

Claude Sonnet 5.5 和 Claude Haiku 5.5 将在未来几周发布。

Opus 5.5 已经在 AWS、Google Cloud 和 Microsoft Azure 上线,API 调用名称是 `claude-opus-5-5`。

Pro、Max 和 Team 订阅用户的五小时使用限额也同步提升,可自主选择何时重置。

官方公告地址:https://www.anthropic.com/claude-opus-5-5

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →