引言
9 月的 AI 圈卷到什么程度?光 9 月 1 日到 3 日,Anthropic、Google、阿里就接连放出新模型。今天评测的主角不是销量最大的那个,而是最「性价比刺客」的一个——阿里 9 月 2 日发布的千问旗舰快照版 Qwen3.8-Max-0902。它不改架构、不涨价,只做了一次定向后训练,就在 Code Arena 前端编程(WebDev)总榜以 1691 分登顶,一度领先 Claude Opus 5 Max 3 分。这次我们结合官方数据和第三方评测平台的信息,帮你判断:它到底值不值得接进你的工作流。
主体内容
它是什么:一次不换底座的「定向充值」。 Qwen3.8-Max-0902 是 8 月发布的 Qwen3.8-Max 的快照版本:同样的 2.4 万亿参数 MoE 架构(单次推理激活约 950 亿),同样的 100 万 tokens 上下文、131K 最大输出,支持文本/图像/视频多模态输入,API 定价也维持输入 $2、输出 $6/百万 tokens 不变,隐式缓存命中低至 $0.25。变化全在上层:围绕「编程(Coding)」和「专业办公(Cowork)」做了专项后训练。这提醒我们一个行业现实——2026 年模型体验的差距,后训练贡献的比重越来越大。
成绩单:提升集中在编程与 Agent,通用能力基本持平。 官方公布的 8 项编程基准全部上涨,其中两项接近翻三倍:TerminalBench 3.0 从 11.3 升到 29.0,ProgramBench 从 10.5 升到 28.0;DeepSWE 1.1 从 56.6 升至 69.3,QwenSWEbench V2 从 55.1 升至 70.0,JobBench 从 53.4 升至 64.0,WorkArena Elo 从 1348 涨到 1468。第三方 Code Arena WebDev 榜则给出 1691 分的首发第一。不过要泼两盆冷水:其一,这些涨幅多为厂商自报,独立复测尚未跟上;其二,领先 Opus 5 Max 的 3 分在 Elo 的置信区间内基本等于噪音,且几天后 Claude Fable 5.1 已以 1765 分反超重回榜首。所以正确的读法是:它稳稳进入了旗舰编程模型的第一梯队,而不是「碾压全球」。
短板也很明确。 0902 快照没有开源权重,可下载的仍是 8 月 12 日版本,想自部署的团队拿不到这批提升;部分对比基准用了阿里自建的评测集,横向比较要打个问号;在 TerminalBench 3.0、ProgramBench 等「难模式」上,Claude Opus 5 仍更稳。另外接入渠道需留意:国内走千问AI平台(千问办公、Qoder、千问 App 已接入),海外走 QwenCloud API 或 OpenRouter(记得固定快照 ID,否则路由会漂移)。
谁该用它: 需要仓库级代码理解、前端项目迭代、批量修 Bug 的研发团队;合同、报表、扫描件类专业文档解析的 B 端场景;以及预算敏感、想要旗舰能力但被 Claude $5/$25、GPT-6 Astra $10/$50 定价劝退的个人开发者。综合约 $5/百万 tokens 的均价,只有 Opus 5 的约 1/5、GPT-6 Astra 的约 1/8。
结论与推荐
- 性价比首选梯队:编程与办公场景下,Qwen3.8-Max-0902 是目前 $2/$6 价位最值得先试的旗舰模型。
- 别被「登顶」二字带节奏:3 分的 Elo 领先是噪音,真正可信的是自家版本 22 分的提升和全线翻倍的编程基准。
- 前端/仓库级任务优先选它,难模式留给 Opus 5:数据与看板类、消费级前端项目它表现最好,硬核终端任务仍有差距。
- API 调用记得固定快照:OpenRouter 上未固定的 slug 已自动切到 0902,生产环境务必钉住模型 ID。
- 国产模型的新信号:不靠参数堆叠、靠后训练提质,是 2026 下半年国产旗舰的共同打法,值得持续关注。
联盟链接
想在千问 App 或 Qoder 里直接体验 0902 快照?开发机上跑模型离不开靠谱的硬件:显卡、内存、开发本可以先逛逛淘宝 AI 硬件精选(淘宝联盟),企业级算力与服务器也可以看看京东 AI 服务器专区(京东联盟)。通过以上链接下单,本站会获得少量佣金,价格不变,感谢支持。