Grok 4.6 发布:重返前沿的 61 分,和一张「每任务 0.84 美元」的账单

8 月 12 日,xAI 发布 Grok 4.6。官方定位说得很清楚:在 Grok 4.5 基础上,重点强化长程 Agent和更复杂的交互与视觉工作——模型要能在研究、代码库分析、从想法到成品应用这类多步骤任务里「钉」住不放手。

跑分:追平 GPT-5.6 Sol,落后 Claude 双旗舰

在 Artificial Analysis Intelligence Index(九项基准的综合分)上,Grok 4.6 拿到 61 分,追平 GPT-5.6 Sol(max),落后 Claude Fable 5(62)和 Claude Opus 5(63)。独立评测机构 Artificial Analysis 的评价是:这让 xAI「回到智能前沿,与 OpenAI 并肩,仅落后 Anthropic」。作为参照,一个月前的 Grok 4.5 是 56 分——一个月涨 5 分,较 Grok 4.3 累计涨 23 分。

真正拉开差距的是 agentic 维度:

  • GDPval-AA v2(真实世界知识工作):Elo 1753,仅次于 Claude Opus 5,与 Fable 5、Qwen3.8 Max 置信区间重叠
  • 𝜏³-Banking(多轮客服+工具使用):50.7%,全榜前二
  • Terminal-Bench v2.1:88.4%,与领先模型持平
  • xAI 自报口径里,CursorBench v3.2 拿到 69.9%,DeepSWE v1.1 65.9%,FrontierCode v1.1 61.3%,均高于 Grok 4.5 的 66.7%/54%/56.6%

也要看官方表格里的另一面:在更新更难的 Terminal-Bench v3.0 上,Grok 4.6 只有 26%,GPT-5.6 Sol 是 34.6%——新版本基准上的差距仍然真实存在,agentic 强不等于全面领先。

训练:让 Grok 4.5 给 4.6 打工

训练侧的官方描述值得细读:Grok 4.6 做了比 4.5 更长的补充训练,使用精选的模型生成数据和高质量工程数据,并改进了优化器和训练配方。然后 xAI 用 Grok 4.5 重新生成覆盖不同推理 effort、agent harness 和领域(STEM、软件工程、知识工作)的 SFT 轨迹,再用基于模型的检查过滤掉问题 trace。之后是覆盖内核优化、Web 开发、计算机辅助设计等领域环境的 agentic RL。老模型当数据工厂、新模型当学生——这条自我迭代流水线正在变成头部厂商的标配。

定价:涨智能不涨价的罕见一代

Artificial Analysis 特别指出:前沿模型的智能上涨通常伴随涨价,而 Grok 4.6 定价维持在每百万 token 2 美元/6 美元(输入/输出),比 Claude Opus 5(5/25 美元)和 GPT-5.6 Sol(5/30 美元)低 60% 以上。实测每任务成本 0.84 美元,与 Kimi K3 相同但智能略高,落在「智能 vs 每任务成本」的 Pareto 前沿上。

更狠的是回合效率:在长程知识工作基准 AA-Briefcase 上,Grok 4.6 平均约 53 个回合、0.5B 输入 token 完成任务,而 Claude Opus 5(max)需要约 103 个回合、2.0B 输入 token。同一层级的答案,一半的回合、四分之一的输入量——长程 Agent 的上下文累积速度决定了,这个 token 效率优势折算成成本远超单价差。唯一的涨价项是缓存命中价,从每百万 0.3 美元涨到 0.5 美元;上下文窗口维持 500k 不变。

所以呢

Grok 4.6 没有任何单项跑分全场第一,但它把「每任务成本」打进了 Intelligence Index 所有 agentic 评测的 Pareto 前沿。当智能分挤在 61–63 的窄带里,决定采购的可能不再是榜单,而是月底那张 token 账单——这大概是这代发布真正值得盯的信号。

来源:xAI 官方发布页Artificial Analysis 独立评测