Grok 4.7 发布拆解:同价换基座重训,Terminal-Bench 翻倍背后是长任务 RL 与自我校验工程
一、版本号只跳 0.1,这其实是一次换基座重训
9 月 21 日,xAI 在官方博客上架了 Grok 4.7,定位是面向编程与知识工作的旗舰模型。
单看版本号,从 4.6 到 4.7 只跳了 0.1,很多人的第一反应是例行小升级。
但官方说明里有一句容易被忽略的话:这是全新的更大基座,不是 4.6 的继续后训练。
理解这一点,才能看懂后面所有基准数字的含义。
换基座意味着模型要从头再来一遍完整训练管线,而不是在原盘上加补丁。
官方同时说,这一轮强化学习在困难任务上训练时间更长,自我检查也更仔细。
安全护栏则是历代最强版本。
这三点组合在一起,指向一个明确的产品意图:Grok 4.7 的假想对手不是聊天机器人,而是数小时起步的专业工作流。
价格没变,输入每百万 Token 仍是 2 美元,输出仍是 6 美元。
也就是说,这是一次不涨价的换基座重训,成本全部由提速和长任务能力来兑现。
从产品节奏看,Grok 系列的更新已经明显转向编程与智能体场景。
上一代 Grok 4.6 发布于 8 月 12 日,间隔仅一个多月。
这种高频节奏背后,是 xAI 对编码 Agent 市场的连续加注。
把 Cursor 收入旗下之后,模型与编辑器的配合成了 xAI 的主攻方向。
Grok Build 作为官方编程工具,也和这次发布同步走向前台。
所以 4.7 不是心血来潮的版本号,而是整个产品线换挡的一部分。
二、Terminal-Bench 翻倍:涨幅最刺眼的数字
官方公布的基准里,涨幅最大的两项都是长链条工程任务。
CursorBench 4.0 从 40.4% 涨到 46.3%,提升 5.9 个百分点。
Terminal-Bench 4.0 从 20.3% 直接跳到 38.0%,接近翻倍。
一个终端任务基准,涨幅是编码任务的三倍多,这个分布本身就说明问题。
终端任务要求模型在真实 shell 环境里连续执行命令、读输出、改文件、再执行。
这类任务的失败往往发生在链条中段,模型一旦迷失目标就前功尽弃。
DeepSWE v1.1 上,Grok 4.7 的高推理强度成绩达到 71.0%。
作为对照,Grok 4.6 只有 65.2%,GPT-5.6 Sol 的成绩是 72.7%。
从横向看,Grok 4.7 在长时编码上已经贴着第一梯队的边。
真正的差距从 CursorBench 能看到,Fable 5.1 Max 是 51.8%,领先约 5 个百分点。
但综合价格因素,这个差距在成本敏感团队里很可能被直接忽略。
值得注意的是,Terminal-Bench 的翻倍不是靠运气刷出来的。
终端场景的变数极大,命令输出、错误信息、路径差异都会改变后续决策。
模型必须学会从真实反馈里修正路线,这在旧版本上恰恰是弱项。
所以这个数字更像是一次能力结构性的补课,而不是调参的红利。
另一个不能忽视的视角是基准的评测口径。
Terminal-Bench 4.0 的场景设计贴近真实 DevOps 工作,造假空间极小。
因此它的翻倍对工程可用的判断价值,高于那些纯问答类榜单。
三、长任务 RL 配比:训练权重向数小时难题倾斜
为什么终端任务涨得比编码任务猛,答案藏在训练数据配比里。
官方明确说,强化学习阶段加权了需要数小时才能完成的复杂任务。
也就是说,训练目标从单轮正确率,迁移到了长链条任务的成功率。
这个迁移直接影响模型的错误模式。
传统 RL 奖励的是正确回答,模型学到的捷径是快速给出局部合理的答案。
长任务加权后,模型被迫学会在长执行链里保持目标一致性。
终端任务的特性恰好放大了这种训练的效果。
每跑一条命令,模型都面临一个真实的反馈信号,成功或失败立即可见。
这让数小时训练样本能产生更强的梯度信号。
反过来看,那些主打单轮问答的模型,在 Terminal-Bench 上普遍表现疲软。
这个数字分布,本质上是把训练哲学晒在了桌面上。
训练配比的另一个侧面是任务难度排序。
不是所有长任务都值得同等权重,真正有价值的是必须多步调用工具的任务。
这类任务在传统评测里往往被平均掉,看出版本差异。
Grok 4.7 把它们单独拎出来加权,才让终端能力的进步显了形。
对研究团队而言,这个配比思路比单点成绩更有参考价值。
更深的含义在于,长任务 RL 正在成为各家模型竞争的默认战场。
当单轮智能趋同,完成复杂工作的持久力就成了新的分水岭。
四、自我校验:模型被显式训练去检查自己的工作
长任务 RL 配比的另一个配套工程是自我校验。
官方博客的说法是,模型被显式训练来验证自己的工作。
粗看这是一句公关话术,但结合基准思路能看出实际做法。
长上下文管理不再依赖外部提示,而是变成了模型自身的能力。
当任务跑了几十分钟,前文的假设可能已经被中间结果推翻。
模型需要回头重新评估早期决策,而不是沿着原路径硬走。
官方提到的错误模式矫正,也解释了社区反馈里的一个现象。
有开发者吐槽 4.7 在简单问题上变啰嗦,这大概率是自我校验的副作用。
模型倾向多检查一步,自然会在简单任务上多花一点 token。
这个权衡对分钟级任务不划算,对小时级任务则是刚需。
所以 Grok 4.7 的调性非常明确:它不为短对话优化,为长工作流优化。
把自我校验做进训练目标的厂商不止 xAI 一家。
但各家做法不同,有的靠外部验证器,有的靠内置反思。
Grok 4.7 的路线是把校验能力和长上下文绑定在一起训练。
这也意味着它的部署形态天然偏向 Agent 运行时,而非纯问答接口。
开发者接入时,应该把这一点纳入架构设计的考量。
自我校验还会影响输出风格的稳定性。
同一个任务在不同推理强度下,路径选择可能完全不同。
这对产品的可解释性提出了新的要求。
五、Grok Bot harness 原生理解:把运行时写进模型
这次发布还有一个容易被忽略的技术点:原生理解 Grok Bot harness。
官方表示,模型直接针对 Grok Bot 的运行框架进行了训练。
harness 在这里指的是承载模型执行任务的运行时外壳。
对话任务和通用知识工作,在这轮训练里表现都有提升。
这相当于把执行框架的知识直接编码进了模型权重。
对开发者来说,这个信号的行业意义比单点提升更大。
模型厂商开始把运行时语义当作训练语料的一部分。
推理范式的竞争,正在从模型本身延伸到模型与执行环境之间的协作层。
这和此前的 MCP、Agent harness 讨论是同一个趋势的不同切面。
谁能把执行环境理解得更好,谁的长任务成功率就更高。
Grok Bot 持续运行在 X 平台之上,天然积累了海量真实交互数据。
这些数据反过来又成为下一轮 harness 训练的养料。
于是模型与运行时之间形成了一条加速循环。
这和开源社区里 Mini-Harness、轻量运行时的思路是同一个方向。
区别只在于,xAI 把这条循环搬进了自己的闭源管线。
对第三方框架作者来说,这个信号值得警惕,也值得借力。
如果闭源模型的 harness 绑定越来越深,可移植性会打折扣。
反过来看,MCP 这类开放协议反而成了对抗锁定的缓冲垫。
两种力量的拉扯,会决定未来两年 Agent 生态的形态。
六、七项基准横向对照

把官方公布的七项主要基准放在一起,能看出一个清晰的画像。
| 基准 | Grok 4.7 | Grok 4.6 | 对比参照 |
| CursorBench 4.0 | 46.3% | 40.4% | Fable 5.1 Max 51.8% |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 接近翻倍 |
| DeepSWE v1.1 | 71.0% | 65.2% | GPT-5.6 Sol 72.7% |
| EEBench | 64.0% | 53.0% | 涨 11 个百分点 |
| AA Briefcase v1.1 | 1657 | 1546 | Fable 5.1 为 1678 |
| Harvey Legal | 19.6% | 15.8% | 涨 3.8 个百分点 |
| HealthBench Pro | 56.7% | 48.5% | 涨 8.2 个百分点 |
表格里涨幅最大的三行,全部是长链条或专业工作类任务。
知识工作侧,GDPval 的 Elo 分数从 1605 涨到 1695。
这个分数只比 Fable 5.1 Max 的 1735 低一档,高于 GPT-6 Astra 的 1542。
官方还强调,文档与演示文稿生成能力这次提升显著。
覆盖的岗位画像包括律师、护士、金融分析师等专业角色。
这些基准有一个共同点:全部都要求多步输出和长期目标保持。
单一问答的评测在官方表里被刻意弱化,产品导向一目了然。
对采购方来说,读这张表要先问一个问题:你的负载是长任务还是短问答。
同一张表,两类用户会得出完全相反的结论。
这正是社区口碑两极分化的技术根源。
另外要提醒一句,厂商自报基准存在口径偏差的可能。
跨模型对比时,推理强度、工具配置、测试环境都可能是变量。
最稳妥的做法是拿自己的真实任务在两边各跑一遍。
本表全部数字取自 xAI 官方 2026-09-21 发布博客与对应模型卡。
第三方评测机构 Artificial Analysis 的口径可以在其公开页交叉核对。
Grok 4.7 的模型 ID、推理强度档位与定价,则应以 docs.x.ai 为准。
七、价格不变:2 美元与 6 美元的成本账
这次发布最具争议也最务实的地方,是价格完全没有动。
标准版输入 2 美元每百万 Token,输出 6 美元每百万 Token。
和 Grok 4.6 完全一致,现有开发者不需要调整预算。
高速版是唯一变化,输出速度翻倍,价格也翻倍。
把价格放回基准图里,能算出更真实的账。
在 CursorBench 上,Grok 4.7 以约一半的成本拿到接近顶级的分数。
对编程 Agent 产品来说,单次调用单价只是成本的一半。
另一半是完成任务需要多少次尝试、多少次返工。
如果错误率下降能减少重试,全链路成本优势会被进一步放大。
这也是同价换基座策略的商业逻辑:用质量换调用次数。
举一个可量化的例子帮助理解。
假设某长任务在旧模型上平均重试三次,每次消耗完整输出量。
新模型把成功率提上去,平均重试降到一次,总成本直接腰斩。
单价不变,但全链路支出大幅下降,这才是定价策略的真实杀伤力。
对中小团队而言,这种成本结构比单纯降价更友好。
因为模型能力提升带来的节省,会随着任务复杂度越滚越大。
从行业视角看,2 美元与 6 美元的锚点已经在压制同行报价。
其他厂商要么跟进降价,要么在专业场景里找到不可替代的溢价点。
价格战之下,真正受益的是把 AI 当基础设施用的开发者。
八、接入方式与推理强度调节
Grok 4.7 已经上线 Cursor、Grok Build 和 Grok API。
第三方 coding harness 与模型路由平台也能直接接入。
API 调用方式与 OpenAI SDK 兼容,迁移成本很低。
from openai import OpenAI
client = OpenAI(
api_key="xai-",
base_url="https://api.x.ai/v1",
)
resp = client.chat.completions.create(
model="grok-4.7",
messages=[
{"role": "user", "content": "重构这个仓库的构建脚本并跑通全部测试"},
],
max_tokens=8192,
reasoning_effort="high",
)
print(resp.choices[0].message.content)
需要注意,上例中的 reasoning_effort 参数用于控制推理强度。
长任务建议调高推理强度,并配合较长的 max_tokens。
不同客户端对推理强度参数的命名略有差异,以官方文档为准。
实际接入时建议先用小任务验证模型 ID 与参数名。
把推理强度做成可配置项,是接入工程里的最佳实践。
简单任务用低档位省 token,复杂任务用高档位保成功率。
这种分级调用能把成本曲线压得更平。
代码里没有额外引入专用依赖,用的是社区通用的 openai 库。
这意味着现有 Agent 框架只需改 base_url 和 model 就能切换。
对已经跑在多个模型之上的团队来说,迁移几乎是零成本。
九、开发者怎么判断该不该换
把这次发布的得失放平,适用场景其实很清晰。
如果你的负载是仓库级重构、多文件修改、长链条终端操作,值得试。
这类任务正是 Terminal-Bench 和 DeepSWE 覆盖的范围。
如果你追求绝对最高分,Fable 5.1 Max 在 CursorBench 仍领先 5 个百分点。
如果你的流量是海量短对话,自我校验带来的 token 开销可能不划算。
社区口碑的两极分化,本质上就是这两类用户的分流。
官方定价策略明显在抢开发者侧的长任务市场。
半价的策略对预算敏感的中小团队杀伤力最大。
对大客户来说,稳定性、SLA 与合规支持仍是更重的决策变量。
安全审查是另一个不可忽略的维度。
官方在 HackerBench v0.3 上只放行了 3.3% 的高风险双重用途提示。
LatchBio 生物安全基准拿到 62.4%,属于行业上游水平。
xAI 还向部分网络安全合作伙伴开放了邀请制红队能力。
这些动作表明,安全能力已经被打包进企业采购的考量里。
如果你的业务涉及敏感场景,起码要跑一遍内部安全回归再上线。
还有一个常被忽略的隐形成本:模型切换带来的工程返工。
提示词、超参、容错逻辑都可能需要重新适配。
切换之前,先把自己的调用模式梳理成一张清单,能省不少事。
十、落地清单
给想立刻试用的团队,列一份可执行的检查单。
第一,用 Cursor 或 Grok Build 先跑一个真实仓库任务,而非玩具示例。
第二,对比同一任务在 4.6 与 4.7 上的成功率与重试次数。
第三,重点测终端类任务,这是本轮提升最明显的场景。
第四,把 max_tokens 调大,避免长任务输出被截断。
第五,记录实际 token 消耗,用全链路成本做决策而不是单价。
第六,安全敏感场景先跑一遍 HackerBench 风格的内部测试。
第七,关注开源承诺的实际兑现,再做长期依赖决策。
第八,把推理强度参数做成可配置项,按任务类型动态切换。
第九,评估 harness 兼容性,确认长任务运行时能稳定对接。
第十,在灰度环境用真实业务任务跑一周,再决定全量迁移。
版本号只跳 0.1 的发布,往往是最容易被低估的一次。
换基座、长任务配比、自我校验、harness 原生理解,四个工程动作指向同一个目标。
编码 Agent 的竞争,已经从模型智商转向了小时级任务的完成率。
谁能在长链条里不迷失,谁才真正进入生产可用区。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)