引言
9 月 21 日,xAI 悄悄放出 Grok 4.7(模型 ID grok-4.7)。它没喊「地表最强」,反而干了一件少见的事——官网对比表里,有两行「最佳成绩」加粗的竟是对手(Fable 5.1 Max、GPT-5.6 Sol)。xAI 把姿态摆得很清楚:我不抢王冠,我占「干活最划算」那个位子。价格跟 4.6 完全持平(输入 $2 / 输出 $6 每百万 token),但长任务编程和智能体基准几乎翻倍。本文用官方数据 + 独立评测交叉验证,说清它到底强在哪、短板是什么、谁该现在就用。
主体内容
一、定位与发布:为「跑几小时的任务」而生
Grok 4.7 是 Grok 4.6 的后继者,xAI 明确把它定位成「编码、智能体、知识工作」的基础设施模型,而不是聊天机器人升级。训练侧有三个关键改动:更大的基座、更长的强化学习时长、任务配比偏向「需要几小时才能完成」的难题。它还首次把自家 Grok Bot 执行沙箱写进了训练目标——这是业内第一次有实验室把某个具体 harness 塞进训练目标里。
上线即日可用:Grok Build(默认模型)、Cursor、xAI API(grok-4.7)、以及一堆第三方编码 harness、模型路由器和云平台。支持文+图输入、纯文本输出,函数调用、结构化输出、联网搜索(含 X 搜索)和代码执行都开放,推理档位 low/medium/high/xhigh,默认 high,上下文 500K。
二、成绩单:进步集中在「长任务」
| 基准 | Grok 4.7 | Grok 4.6 | 同档对手 |
|---|---|---|---|
| CursorBench 4.0(长程编码) | 46.3% | 40.4% | Fable 5.1 Max 51.8% / Sol 41.7% |
| DeepSWE v1.1(high 档) | 71.0% | 65.2% | Sol 72.7% / Fable 70.0% |
| Terminal-Bench 4.0(终端操作) | 38.0% | 20.3% | GPT-6 Astra 57.9% / Opus 5 51.8% |
| EEBench(电气工程) | 64.0% | — | 领先第二 8 分 |
| Harvey Legal Agent | 19.6% | — | 偏弱,仍如实公布 |
| 独立 Artificial Analysis 智力指数 | 46 | — | — |
| Coding Agent Index(配 Grok Build) | 56 | 47 | +9 分 |
关键读图:进步几乎全落在「能跑几十次工具调用、改几十个文件」的长任务上,而不是闲聊质量。独立评测给的总体 9.2/10,评价是「9 月编程智能体里性价比最强之一」。
三、实战性价比:90% 能力,1/5 价格
最有传播力的一句话:Grok 4.7 在 CursorBench 上拿到 Fable 5.1 Max 约 90% 的分数,价格却是 $2/$6 对 $10/$50——约五分之一到八分之一。社区共识是「智能体编程排第三,仅次于 Anthropic 和 OpenAI,但算上速度和成本,它是绝佳的每日打工马」。
价格细节要记牢:200K token 以内输入 $2 / 输出 $6,缓存输入 $0.50;超过 200K 涨到 $4 / $12。另有 Grok 4.7 Fast 变体——输出速度翻倍、价格也翻倍。「速度本身成了 SKU」,这是 4.7 一个真新动作。
四、安全卖点:连「叛逆实验室」都开始卖「 containment」
过去以宽松著称的 xAI,这次把安全当成卖点讲:全新安全栈在 HackerBench v0.3(高风险双用途网络任务)上只放行 3.3% 的提示,同时很少误拦正当安全任务。换句话说,它既堵住了越狱,又不至于把正常研究卡死。对要接进企业流程的团队,这条比分数更值钱。
五、三个必须直说的短板
- 不是王冠:CursorBench 仍输 Fable 5.1 Max 5.5 分,DeepSWE 微输 Sol;真要冲顶级 coding agent,Anthropic / OpenAI 仍略占优。
- xhigh 档极其费 token:官方自己也承认,最高推理档会消耗大量输出 token,长任务账单可能失控,日常建议 high 或 medium。
- 法律/临床弱项:Harvey Legal 仅 19.6%,医疗、法务这类高合规场景别当成主力。
六、谁该现在用
- ✅ 日常编码智能体、长程多步工具调用、终端运维自动化——性价比首选。
- ✅ 预算敏感、要跑大量 agent 循环的小团队——用路由器把简单任务切给 4.7 能砍掉近一半模型支出。
- ❌ 追求绝对榜单第一、或做法律/临床严肃任务——另选专用模型。
结论与推荐
- Grok 4.7 是 9 月「性价比工位」冠军:同价性能近乎翻倍,长任务编程跃升明显。
- 它不抢王冠,但占了最实用的位子:90% 旗舰能力、1/5 价格,日常打工比追顶配更划算。
- 价格看门槛:200K 内 $2/$6,超 200K 翻倍,缓存输入 $0.50 记得开;Fast 变体按速度需求选。
- xhigh 档慎用:日常 high/medium 即可,避免长任务 token 账单爆炸。
- 安全栈是隐藏加分项:越狱抵抗拉满又不误伤正经研究,企业接入更放心。
联盟链接
- 想自己跑 Grok 4.7 的编码智能体,配一套舒服的人体工学椅 + 升降桌 workstation 很关键——长时间盯 agent 跑任务,腰和脖子先顶不住。京东联盟人体工学专区可查看同款:[京东联盟占位链接,发布前替换]
- 需要本地部署同类开源模型的,可顺手备一块显卡 / 开发板,淘宝联盟搜索入口(带 PID):
https://s.taobao.com/search?q=显卡&pid=2038464175_4107429456_3107884483(发布前替换为正式追踪链接) - 提示:本文所有基准均来自 xAI 官方发布页(截至 2026-09-21)及 Artificial Analysis 独立评测,个别社区成本对比未独立核实,下单前以官方实时报价为准。