一、版本号只跳 0.1,这其实是一次换基座重训

9 月 21 日,xAI 在官方博客上架了 Grok 4.7,定位是面向编程与知识工作的旗舰模型。

单看版本号,从 4.6 到 4.7 只跳了 0.1,很多人的第一反应是例行小升级。

但官方说明里有一句容易被忽略的话:这是全新的更大基座,不是 4.6 的继续后训练。

理解这一点,才能看懂后面所有基准数字的含义。

换基座意味着模型要从头再来一遍完整训练管线,而不是在原盘上加补丁。

官方同时说,这一轮强化学习在困难任务上训练时间更长,自我检查也更仔细。

安全护栏则是历代最强版本。

这三点组合在一起,指向一个明确的产品意图:Grok 4.7 的假想对手不是聊天机器人,而是数小时起步的专业工作流。

价格没变,输入每百万 Token 仍是 2 美元,输出仍是 6 美元。

也就是说,这是一次不涨价的换基座重训,成本全部由提速和长任务能力来兑现。

从产品节奏看,Grok 系列的更新已经明显转向编程与智能体场景。

上一代 Grok 4.6 发布于 8 月 12 日,间隔仅一个多月。

这种高频节奏背后,是 xAI 对编码 Agent 市场的连续加注。

把 Cursor 收入旗下之后,模型与编辑器的配合成了 xAI 的主攻方向。

Grok Build 作为官方编程工具,也和这次发布同步走向前台。

所以 4.7 不是心血来潮的版本号,而是整个产品线换挡的一部分。

二、Terminal-Bench 翻倍:涨幅最刺眼的数字

官方公布的基准里,涨幅最大的两项都是长链条工程任务。

CursorBench 4.0 从 40.4% 涨到 46.3%,提升 5.9 个百分点。

Terminal-Bench 4.0 从 20.3% 直接跳到 38.0%,接近翻倍。

一个终端任务基准,涨幅是编码任务的三倍多,这个分布本身就说明问题。

终端任务要求模型在真实 shell 环境里连续执行命令、读输出、改文件、再执行。

这类任务的失败往往发生在链条中段,模型一旦迷失目标就前功尽弃。

DeepSWE v1.1 上,Grok 4.7 的高推理强度成绩达到 71.0%。

作为对照,Grok 4.6 只有 65.2%,GPT-5.6 Sol 的成绩是 72.7%。

从横向看,Grok 4.7 在长时编码上已经贴着第一梯队的边。

真正的差距从 CursorBench 能看到,Fable 5.1 Max 是 51.8%,领先约 5 个百分点。

但综合价格因素,这个差距在成本敏感团队里很可能被直接忽略。

值得注意的是,Terminal-Bench 的翻倍不是靠运气刷出来的。

终端场景的变数极大,命令输出、错误信息、路径差异都会改变后续决策。

模型必须学会从真实反馈里修正路线,这在旧版本上恰恰是弱项。

所以这个数字更像是一次能力结构性的补课,而不是调参的红利。

另一个不能忽视的视角是基准的评测口径。

Terminal-Bench 4.0 的场景设计贴近真实 DevOps 工作,造假空间极小。

因此它的翻倍对工程可用的判断价值,高于那些纯问答类榜单。

三、长任务 RL 配比:训练权重向数小时难题倾斜

为什么终端任务涨得比编码任务猛,答案藏在训练数据配比里。

官方明确说,强化学习阶段加权了需要数小时才能完成的复杂任务。

也就是说,训练目标从单轮正确率,迁移到了长链条任务的成功率。

这个迁移直接影响模型的错误模式。

传统 RL 奖励的是正确回答,模型学到的捷径是快速给出局部合理的答案。

长任务加权后,模型被迫学会在长执行链里保持目标一致性。

终端任务的特性恰好放大了这种训练的效果。

每跑一条命令,模型都面临一个真实的反馈信号,成功或失败立即可见。

这让数小时训练样本能产生更强的梯度信号。

反过来看,那些主打单轮问答的模型,在 Terminal-Bench 上普遍表现疲软。

这个数字分布,本质上是把训练哲学晒在了桌面上。

训练配比的另一个侧面是任务难度排序。

不是所有长任务都值得同等权重,真正有价值的是必须多步调用工具的任务。

这类任务在传统评测里往往被平均掉,看出版本差异。

Grok 4.7 把它们单独拎出来加权,才让终端能力的进步显了形。

对研究团队而言,这个配比思路比单点成绩更有参考价值。

更深的含义在于,长任务 RL 正在成为各家模型竞争的默认战场。

当单轮智能趋同,完成复杂工作的持久力就成了新的分水岭。

四、自我校验:模型被显式训练去检查自己的工作

长任务 RL 配比的另一个配套工程是自我校验。

官方博客的说法是,模型被显式训练来验证自己的工作。

粗看这是一句公关话术,但结合基准思路能看出实际做法。

长上下文管理不再依赖外部提示,而是变成了模型自身的能力。

当任务跑了几十分钟,前文的假设可能已经被中间结果推翻。

模型需要回头重新评估早期决策,而不是沿着原路径硬走。

官方提到的错误模式矫正,也解释了社区反馈里的一个现象。

有开发者吐槽 4.7 在简单问题上变啰嗦,这大概率是自我校验的副作用。

模型倾向多检查一步,自然会在简单任务上多花一点 token。

这个权衡对分钟级任务不划算,对小时级任务则是刚需。

所以 Grok 4.7 的调性非常明确:它不为短对话优化,为长工作流优化。

把自我校验做进训练目标的厂商不止 xAI 一家。

但各家做法不同,有的靠外部验证器,有的靠内置反思。

Grok 4.7 的路线是把校验能力和长上下文绑定在一起训练。

这也意味着它的部署形态天然偏向 Agent 运行时,而非纯问答接口。

开发者接入时,应该把这一点纳入架构设计的考量。

自我校验还会影响输出风格的稳定性。

同一个任务在不同推理强度下,路径选择可能完全不同。

这对产品的可解释性提出了新的要求。

五、Grok Bot harness 原生理解:把运行时写进模型

这次发布还有一个容易被忽略的技术点:原生理解 Grok Bot harness。

官方表示,模型直接针对 Grok Bot 的运行框架进行了训练。

harness 在这里指的是承载模型执行任务的运行时外壳。

对话任务和通用知识工作,在这轮训练里表现都有提升。

这相当于把执行框架的知识直接编码进了模型权重。

对开发者来说,这个信号的行业意义比单点提升更大。

模型厂商开始把运行时语义当作训练语料的一部分。

推理范式的竞争,正在从模型本身延伸到模型与执行环境之间的协作层。

这和此前的 MCP、Agent harness 讨论是同一个趋势的不同切面。

谁能把执行环境理解得更好,谁的长任务成功率就更高。

Grok Bot 持续运行在 X 平台之上,天然积累了海量真实交互数据。

这些数据反过来又成为下一轮 harness 训练的养料。

于是模型与运行时之间形成了一条加速循环。

这和开源社区里 Mini-Harness、轻量运行时的思路是同一个方向。

区别只在于,xAI 把这条循环搬进了自己的闭源管线。

对第三方框架作者来说,这个信号值得警惕,也值得借力。

如果闭源模型的 harness 绑定越来越深,可移植性会打折扣。

反过来看,MCP 这类开放协议反而成了对抗锁定的缓冲垫。

两种力量的拉扯,会决定未来两年 Agent 生态的形态。

六、七项基准横向对照

把官方公布的七项主要基准放在一起,能看出一个清晰的画像。

基准Grok 4.7Grok 4.6对比参照
CursorBench 4.046.3%40.4%Fable 5.1 Max 51.8%
Terminal-Bench 4.038.0%20.3%接近翻倍
DeepSWE v1.171.0%65.2%GPT-5.6 Sol 72.7%
EEBench64.0%53.0%涨 11 个百分点
AA Briefcase v1.116571546Fable 5.1 为 1678
Harvey Legal19.6%15.8%涨 3.8 个百分点
HealthBench Pro56.7%48.5%涨 8.2 个百分点

表格里涨幅最大的三行,全部是长链条或专业工作类任务。

知识工作侧,GDPval 的 Elo 分数从 1605 涨到 1695。

这个分数只比 Fable 5.1 Max 的 1735 低一档,高于 GPT-6 Astra 的 1542。

官方还强调,文档与演示文稿生成能力这次提升显著。

覆盖的岗位画像包括律师、护士、金融分析师等专业角色。

这些基准有一个共同点:全部都要求多步输出和长期目标保持。

单一问答的评测在官方表里被刻意弱化,产品导向一目了然。

对采购方来说,读这张表要先问一个问题:你的负载是长任务还是短问答。

同一张表,两类用户会得出完全相反的结论。

这正是社区口碑两极分化的技术根源。

另外要提醒一句,厂商自报基准存在口径偏差的可能。

跨模型对比时,推理强度、工具配置、测试环境都可能是变量。

最稳妥的做法是拿自己的真实任务在两边各跑一遍。

本表全部数字取自 xAI 官方 2026-09-21 发布博客与对应模型卡。

第三方评测机构 Artificial Analysis 的口径可以在其公开页交叉核对。

Grok 4.7 的模型 ID、推理强度档位与定价,则应以 docs.x.ai 为准。

七、价格不变:2 美元与 6 美元的成本账

这次发布最具争议也最务实的地方,是价格完全没有动。

标准版输入 2 美元每百万 Token,输出 6 美元每百万 Token。

和 Grok 4.6 完全一致,现有开发者不需要调整预算。

高速版是唯一变化,输出速度翻倍,价格也翻倍。

把价格放回基准图里,能算出更真实的账。

在 CursorBench 上,Grok 4.7 以约一半的成本拿到接近顶级的分数。

对编程 Agent 产品来说,单次调用单价只是成本的一半。

另一半是完成任务需要多少次尝试、多少次返工。

如果错误率下降能减少重试,全链路成本优势会被进一步放大。

这也是同价换基座策略的商业逻辑:用质量换调用次数。

举一个可量化的例子帮助理解。

假设某长任务在旧模型上平均重试三次,每次消耗完整输出量。

新模型把成功率提上去,平均重试降到一次,总成本直接腰斩。

单价不变,但全链路支出大幅下降,这才是定价策略的真实杀伤力。

对中小团队而言,这种成本结构比单纯降价更友好。

因为模型能力提升带来的节省,会随着任务复杂度越滚越大。

从行业视角看,2 美元与 6 美元的锚点已经在压制同行报价。

其他厂商要么跟进降价,要么在专业场景里找到不可替代的溢价点。

价格战之下,真正受益的是把 AI 当基础设施用的开发者。

八、接入方式与推理强度调节

Grok 4.7 已经上线 Cursor、Grok Build 和 Grok API。

第三方 coding harness 与模型路由平台也能直接接入。

API 调用方式与 OpenAI SDK 兼容,迁移成本很低。

from openai import OpenAI

client = OpenAI(
    api_key="xai-",
    base_url="https://api.x.ai/v1",
)

resp = client.chat.completions.create(
    model="grok-4.7",
    messages=[
        {"role": "user", "content": "重构这个仓库的构建脚本并跑通全部测试"},
    ],
    max_tokens=8192,
    reasoning_effort="high",
)

print(resp.choices[0].message.content)

需要注意,上例中的 reasoning_effort 参数用于控制推理强度。

长任务建议调高推理强度,并配合较长的 max_tokens。

不同客户端对推理强度参数的命名略有差异,以官方文档为准。

实际接入时建议先用小任务验证模型 ID 与参数名。

把推理强度做成可配置项,是接入工程里的最佳实践。

简单任务用低档位省 token,复杂任务用高档位保成功率。

这种分级调用能把成本曲线压得更平。

代码里没有额外引入专用依赖,用的是社区通用的 openai 库。

这意味着现有 Agent 框架只需改 base_url 和 model 就能切换。

对已经跑在多个模型之上的团队来说,迁移几乎是零成本。

九、开发者怎么判断该不该换

把这次发布的得失放平,适用场景其实很清晰。

如果你的负载是仓库级重构、多文件修改、长链条终端操作,值得试。

这类任务正是 Terminal-Bench 和 DeepSWE 覆盖的范围。

如果你追求绝对最高分,Fable 5.1 Max 在 CursorBench 仍领先 5 个百分点。

如果你的流量是海量短对话,自我校验带来的 token 开销可能不划算。

社区口碑的两极分化,本质上就是这两类用户的分流。

官方定价策略明显在抢开发者侧的长任务市场。

半价的策略对预算敏感的中小团队杀伤力最大。

对大客户来说,稳定性、SLA 与合规支持仍是更重的决策变量。

安全审查是另一个不可忽略的维度。

官方在 HackerBench v0.3 上只放行了 3.3% 的高风险双重用途提示。

LatchBio 生物安全基准拿到 62.4%,属于行业上游水平。

xAI 还向部分网络安全合作伙伴开放了邀请制红队能力。

这些动作表明,安全能力已经被打包进企业采购的考量里。

如果你的业务涉及敏感场景,起码要跑一遍内部安全回归再上线。

还有一个常被忽略的隐形成本:模型切换带来的工程返工。

提示词、超参、容错逻辑都可能需要重新适配。

切换之前,先把自己的调用模式梳理成一张清单,能省不少事。

十、落地清单

给想立刻试用的团队,列一份可执行的检查单。

第一,用 Cursor 或 Grok Build 先跑一个真实仓库任务,而非玩具示例。

第二,对比同一任务在 4.6 与 4.7 上的成功率与重试次数。

第三,重点测终端类任务,这是本轮提升最明显的场景。

第四,把 max_tokens 调大,避免长任务输出被截断。

第五,记录实际 token 消耗,用全链路成本做决策而不是单价。

第六,安全敏感场景先跑一遍 HackerBench 风格的内部测试。

第七,关注开源承诺的实际兑现,再做长期依赖决策。

第八,把推理强度参数做成可配置项,按任务类型动态切换。

第九,评估 harness 兼容性,确认长任务运行时能稳定对接。

第十,在灰度环境用真实业务任务跑一周,再决定全量迁移。

版本号只跳 0.1 的发布,往往是最容易被低估的一次。

换基座、长任务配比、自我校验、harness 原生理解,四个工程动作指向同一个目标。

编码 Agent 的竞争,已经从模型智商转向了小时级任务的完成率。

谁能在长链条里不迷失,谁才真正进入生产可用区。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐