引言
2026 年 9 月,Anthropic 在 22 日推出 Opus 5.5 后仅六天,又于 28 日放出中端型号 Claude Sonnet 5.5。它维持 Sonnet 5 的 2/10 美元定价,却在终端智能体编程基准 Terminal-Bench 4.0 上以 70.6% 反超旗舰 Opus 5.5 的 66.4%。这篇评测只回答一个问题:在大多数日常场景里,你是不是该把默认模型从 Opus 换成 Sonnet 了?
主体内容
一、定位:Claude 5.5 家族的「性价比型号」
Sonnet 5.5 是 Claude 5.5 家族的第二款型号,定位在 Opus 5.5(旗舰)之下、待发布的 Haiku 5.5 之上。它的核心卖点不是「更强」,而是「几乎一样强,但便宜一半、快三成」。API 价格与 Sonnet 5 完全一致:输入 2 美元、输出 10 美元 / 百万 token;Opus 5.5 则是 4/20 美元,正好两倍。上下文 1M token、最大输出 128K、知识截止 2026 年 6 月,全平台可用(Claude.ai 免费版、Claude Platform、AWS Bedrock、Google Vertex AI、Azure、OpenRouter)。
二、成绩单:哪里追平、哪里反超
| 基准(厂商自报,2026-09-28) | Sonnet 5.5 | Opus 5.5 | Sonnet 5 |
|---|---|---|---|
| Terminal-Bench 4.0(终端智能体编程) | 70.6% | 66.4% | 10.3% |
| FrontierCode 1.1(最高努力) | 46.2% | 54.4% | 42.4% |
| CursorBench 4.0 | 55.5% | 57.8% | 34.1% |
| GDPval-AA v2.1(知识工作 Elo) | 1844 | 1846 | 1449 |
| OSWorld 2.1(电脑操作) | 80.1% | 81.8% | 57.0% |
| Chartography(图表识别) | 61.6% | 64.4% | 15.6% |
| SWE-bench Pro(多文件仓库) | 81.3% | 89.9% | — |
| HLE·带工具 | 64.5% | 67.7% | — |
最亮眼的是 Terminal-Bench 4.0:Sonnet 5.5 的 70.6% 是 Anthropic 所有 Claude 表里最高的终端编程分,比 Opus 5.5 高 4 个点(±2.5 标准误差内,领先但幅度不大)。独立机构 Artificial Analysis 在自己环境测得 Sonnet 63.6% vs Opus 59.6%,方向一致;Vals AI 同基准两者几乎打平(64.1% vs 65.2%)。知识工作(GDPval-AA)两者几乎齐平,比上代 Sonnet 5 高出约 400 Elo。
要泼盆冷水:Sonnet 5 那 10.3% 跑的是更新、更难的 Terminal-Bench 4.0(它发布时用的是旧版 harness),所以「十倍跃升」有一半是换基准造成的,别全信。
三、价格与真实成本:半价是 token,不是 task
token 单价 Sonnet 比 Opus 便宜一倍,但「单次任务成本」未必更省。Vals AI 在 Terminal-Bench 4.0 实测里,Sonnet 5.5 单次任务花 16.51 美元、Opus 5.5 花 13.20 美元——更便宜的型号反而更贵,因为它吐了更多输出 token。Anthropic 也说 Sonnet 5.5 比 Sonnet 5 单次任务最多省 30%,但努力档拉到 max 时,单次任务成本从 high 档的 1.08 美元飙升到 7.60 美元(接近 Opus max 的 8.71)。结论:默认用 medium/high 档,别无脑拉满。客户实测则利好明显——Balyasny 在 2441 个金融任务上,Sonnet 5.5 单答约 12.1 万 token,Sonnet 5 是 49.7 万(少约 75%);Box 快 2.4 倍、总 token 少 12%;Slack 多数离线评测更好、输出 token 少约 14%。
四、实战可用性:已经到处能用了
- Claude Code v2.1.284 起,API 计费用户的 Sonnet 别名默认就是 5.5;
- Cursor、GitHub Copilot 发布当天即上线,设置里开启即可;
- Claude.ai 免费版直接白嫖,Bedrock / Vertex / Azure / OpenRouter 全平台覆盖;
- 1M 上下文 + 128K 输出,长代码库、长文档单会话不截断;
- 首次给 Sonnet 加了接近 Opus 的网络安全护栏与「推理抽取」分类器。
五、三个必须直说的短板
- 最难的任务仍是 Opus 的地盘:FrontierCode、CursorBench、SWE-bench Pro、HLE、OSWorld 上 Opus 5.5 全胜。多文件架构、长程模糊、容错成本高的任务,别为省 token 翻车。
- 思考不能彻底关:想零思考得用
between_tools把前置思考关掉,低延迟流水线要留意。 - 基准多为厂商自报,独立复现刚起步:max 档性价比崩、别当默认;被某些客户任务里「更便宜的型号反而更贵」提醒——按 task 而非 token 算账。
六、谁该用
- ✅ 每天写代码 / 跑 agent 的开发者:把默认模型切到 Sonnet 5.5,token 成本只有 Opus 一半。
- ✅ 文档 / 表格 / 分析类办公流:质量持平 Opus,速度更快、成本更低。
- ❌ 长程无人值守 agent、多文件架构攻坚:还是 Opus 5.5 更稳,这笔钱值得花。
七、任务路由速查:什么活交给谁
| 任务类型 | 推荐模型 | 理由 |
|---|---|---|
| 日常编码、终端 agent、跑脚本 | Sonnet 5.5 | Terminal-Bench 反超 Opus,成本减半 |
| 文档 / 表格 / 分析类办公流 | Sonnet 5.5 | 质量持平 Opus,更快更便宜 |
| 多文件架构、长程模糊需求 | Opus 5.5 | FrontierCode / SWE-bench Pro 全面领先 |
| 长程无人值守 agent | Opus 5.5 | 容错成本低,别在关键路径省 token |
| 免费试用 / 轻量问答 | Sonnet 5.5(免费版) | 直接白嫖旗舰级能力 |
一句话口诀:边界清、量大的用 Sonnet;模糊、长程、容错贵的用 Opus。
结论与推荐
- 量大、任务边界清晰的,直接 Sonnet 5.5 当默认:token 成本只有 Opus 一半,日常编程/办公几乎无感降质。
- 终端 / 命令行类 agent 编程,优先 Sonnet 5.5:Terminal-Bench 4.0 基准反而更高,是它最值得吹的点。
- 多文件架构、长程模糊、容错成本高的任务,继续 Opus 5.5:别为省 token 在关键路径上翻车。
- 努力档默认 medium/high:max 档单次任务成本暴涨近 7 倍,非必要不开。
- 已在用 Claude Code / Cursor / Copilot 的,核对模型别名已切到 5.5;免费版用户直接白嫖,这是 9 月最划算的「旗舰级降级」。
联盟链接
- 长时间盯 Claude Code / Cursor 跑 agent,一套舒服的人体工学椅 + 升降桌 workstation 很关键——腰和脖子先顶不住。京东联盟人体工学专区可查看同款:[京东联盟占位链接,发布前替换]
- 想在本地部署同类开源模型做私有化对比的,可顺手备一块显卡 / 开发板,淘宝联盟搜索入口(带 PID):
https://s.taobao.com/search?q=显卡&pid=2038464175_4107429456_3107884483(发布前替换为正式追踪链接) - 提示:本文基准主要来自 Anthropic 官方发布页(2026-09-28)及 Artificial Analysis / Vals AI 独立评测,多为厂商自报数据、个别第三方 task 成本对比未独立复现,下单前以官方实时报价为准。