引言
9 月 22 日,Anthropic 悄悄放出 Claude 5.5 家族首款模型 Opus 5.5。它最抓人的不是某项跑分登顶,而是把原本属于旗舰 Fable 5.1 的能力,用 $4/$20 每百万 token 的价位搬了下来——相比 Fable 5.1 的 $10/$50,单价直接砍到 60%。对跑长任务 Agent、做代码迁移的团队来说,这是一次「同性能、低账单」的实打实升级。本文基于 Anthropic 官方数据 + 第三方 Artificial Analysis 独立榜单,帮你判断它到底值不值得现在切过去。
主体内容
一、定位:把「旗舰能力」做成「日常可负担」
Opus 5.5 的 API 名是 claude-opus-5-5,9 月 22 日随 Claude 平台、AWS Bedrock、Google Cloud、微软 Azure/Foundry 同步上线。它继承了高端 Claude 线的 1M token 上下文(最大输出 128K),思维链默认常开、改为「自适应思考 + 档位调节」,默认中档。Anthropic 在文档里直接建议:大多数负载用 Opus 5.5,只把 Fable 5.1 留给最吃推理的长程任务。换句话说,它自己把自家的顶配「降级」成了主力。
二、成绩单:代理式编程是主战场(数据多为 Anthropic 自报)
官方给出的核心数字(已开启生产级安全护栏):
| 测试 | Opus 5.5 | Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench 4.0(命令行 Agent) | 66.4% | 55.8% | 57.9% |
| FrontierCode v1.1(编程 Agent) | 54.4% | 50.3% | 53.3% |
| CursorBench 4.0(编码) | 57.8% | 51.8% | 41.7% |
| GDPval-AA v2.1(知识工作 Elo) | 1846 | 1735 | 1542 |
| AutomationBench(业务流程) | 40.0% | 31.4% | 41.4% |
| Terminal-Bench-Science(科研) | 58.7% | 52.6% | 64.6% |
| Humanity's Last Exam(专家题) | 67.7% | 65.6% | 57.2% |
规律很清楚:编程、知识工作、电脑操作它赢;业务流程和科研 Agent 仍被 GPT-6 Astra 压一头。第三方 Artificial Analysis 的 Intelligence Index 给了它 58 分、位列第一,领先 Fable 5.1 与 GPT-6 Astra 的 53 分——这是目前少有的独立背书。
三、实战:长任务真的省钱
Anthropic 内部把 HAProxy 从 C 改写到 Rust,Opus 5.5 用 9.5 小时完成,成本比 Fable 5.1 低 51%;有早期测试者不到一天搬完 68 万行代码迁移;财报核对测试中 18 份报告 16 份达标,上代都没过。典型负载官方称比 Opus 5 便宜约 40%、输出快 30% 以上。
四、价格:这才是重点
- 标准价:$4 / $20 每百万输入/输出 token
- 缓存读取 $0.20(比 Opus 5 降 60%)、缓存写入 $5
- Fast 模式(约 2.5× 速度):$8 / $40
- 对比 Fable 5.1($10/$50):同样价位档,Opus 5.5 便宜 60%
五、三个必须直说的短板
- 数字基本是自家报的。 上表除 Artificial Analysis 的 58 分外,均为 Anthropic 官方评测,且开启安全护栏后部分网安/生物任务会回退到 Opus 4.8/5,分数可能偏低——但这是「保守口径」,值得肯定。
- 不是全胜。 AutomationBench、Terminal-Bench-Science 输给 GPT-6 Astra,且 Anthropic 自己承认「到这个水平,跑分差距已不太能代表真实差异」。
- 长思考更费 token。 自适应思考常开后,复杂任务输出 token 会涨,账单优势要靠缓存和长上下文摊薄,别只看单价。
六、适合谁 / 不适合谁
- 适合: 跑 Claude Code、长程代码迁移、财报/法务研究的团队;预算敏感又想要旗舰级 Agent 能力的开发者。
- 不适合: 纯科研 Agent、超大规模业务流程编排(先看 GPT-6 Astra);只想要最便宜模型的轻度用户(等 Sonnet 5.5 / Haiku 5.5 几周后上线更划算)。
结论与推荐
- 结论先行:Opus 5.5 是目前「性价比最高的旗舰级 Agent 模型」之一,对已在 Fable 5.1 上跑编程 Agent 的团队,本周就该自己复测一遍——同一份活儿账单可能砍掉 60%。
- 迁移成本极低:本质就是换个 model 字符串,不是重写流程,值得立刻 A/B。
- 别迷信单一跑分:编程/知识工作选它,科研/业务流程看 GPT-6 Astra,按任务分桶最稳。
- 上缓存、控思考档位:把大上下文和缓存读用满,才能把单价优势落进真实账单。
- 等两周更香:Sonnet 5.5 / Haiku 5.5 即将发布,轻量场景可以再等等,主力长任务现在就能换。
联盟链接
- 想本地搭一套舒服的 Agent 工作台?一把好的人体工学椅 + 升降桌能让你盯长任务不累,京东联盟专区可挑:京东联盟·人体工学椅专区(发布前请替换为正式推广位)。
- 入手机械键盘、降噪耳机等开发配件,可用淘宝联盟搜索比价(PID:2038464175_4107429456_3107884483,发布前替换为正式追踪链接)。
- 正式接入前,建议先到 Anthropic 官网 用免费额度跑通一个真实任务再决定。