Claude Opus 5.5 评测:单价砍到 60%、性能追平 Fable 5.1,Agent 团队值得换吗?

引言

9 月 22 日,Anthropic 悄悄放出 Claude 5.5 家族首款模型 Opus 5.5。它最抓人的不是某项跑分登顶,而是把原本属于旗舰 Fable 5.1 的能力,用 $4/$20 每百万 token 的价位搬了下来——相比 Fable 5.1 的 $10/$50,单价直接砍到 60%。对跑长任务 Agent、做代码迁移的团队来说,这是一次「同性能、低账单」的实打实升级。本文基于 Anthropic 官方数据 + 第三方 Artificial Analysis 独立榜单,帮你判断它到底值不值得现在切过去。

主体内容

一、定位:把「旗舰能力」做成「日常可负担」

Opus 5.5 的 API 名是 claude-opus-5-5,9 月 22 日随 Claude 平台、AWS Bedrock、Google Cloud、微软 Azure/Foundry 同步上线。它继承了高端 Claude 线的 1M token 上下文(最大输出 128K),思维链默认常开、改为「自适应思考 + 档位调节」,默认中档。Anthropic 在文档里直接建议:大多数负载用 Opus 5.5,只把 Fable 5.1 留给最吃推理的长程任务。换句话说,它自己把自家的顶配「降级」成了主力。

二、成绩单:代理式编程是主战场(数据多为 Anthropic 自报)

官方给出的核心数字(已开启生产级安全护栏):

测试Opus 5.5Fable 5.1GPT-6 Astra
Terminal-Bench 4.0(命令行 Agent)66.4%55.8%57.9%
FrontierCode v1.1(编程 Agent)54.4%50.3%53.3%
CursorBench 4.0(编码)57.8%51.8%41.7%
GDPval-AA v2.1(知识工作 Elo)184617351542
AutomationBench(业务流程)40.0%31.4%41.4%
Terminal-Bench-Science(科研)58.7%52.6%64.6%
Humanity's Last Exam(专家题)67.7%65.6%57.2%

规律很清楚:编程、知识工作、电脑操作它赢;业务流程和科研 Agent 仍被 GPT-6 Astra 压一头。第三方 Artificial Analysis 的 Intelligence Index 给了它 58 分、位列第一,领先 Fable 5.1 与 GPT-6 Astra 的 53 分——这是目前少有的独立背书。

三、实战:长任务真的省钱

Anthropic 内部把 HAProxy 从 C 改写到 Rust,Opus 5.5 用 9.5 小时完成,成本比 Fable 5.1 低 51%;有早期测试者不到一天搬完 68 万行代码迁移;财报核对测试中 18 份报告 16 份达标,上代都没过。典型负载官方称比 Opus 5 便宜约 40%、输出快 30% 以上。

四、价格:这才是重点

五、三个必须直说的短板

  1. 数字基本是自家报的。 上表除 Artificial Analysis 的 58 分外,均为 Anthropic 官方评测,且开启安全护栏后部分网安/生物任务会回退到 Opus 4.8/5,分数可能偏低——但这是「保守口径」,值得肯定。
  2. 不是全胜。 AutomationBench、Terminal-Bench-Science 输给 GPT-6 Astra,且 Anthropic 自己承认「到这个水平,跑分差距已不太能代表真实差异」。
  3. 长思考更费 token。 自适应思考常开后,复杂任务输出 token 会涨,账单优势要靠缓存和长上下文摊薄,别只看单价。

六、适合谁 / 不适合谁

结论与推荐

  1. 结论先行:Opus 5.5 是目前「性价比最高的旗舰级 Agent 模型」之一,对已在 Fable 5.1 上跑编程 Agent 的团队,本周就该自己复测一遍——同一份活儿账单可能砍掉 60%。
  2. 迁移成本极低:本质就是换个 model 字符串,不是重写流程,值得立刻 A/B。
  3. 别迷信单一跑分:编程/知识工作选它,科研/业务流程看 GPT-6 Astra,按任务分桶最稳。
  4. 上缓存、控思考档位:把大上下文和缓存读用满,才能把单价优势落进真实账单。
  5. 等两周更香:Sonnet 5.5 / Haiku 5.5 即将发布,轻量场景可以再等等,主力长任务现在就能换。

联盟链接

相关推荐自适应内嵌广告接入百度联盟/AdSense 后替换此处代码
底部广告728x90 横幅广告接入百度联盟/AdSense 后替换此处代码