技术背景:Agentic 能力成新一代旗舰必争之地
2026 年下半年,前沿大模型的竞争轴心已经从"谁的 benchmark 跑分高"切换到"谁能在真实 agent 工作流里扛活"。Claude Opus 5、GPT-5.6 Sol、Kimi K3 在 GDPval-AA v2、Terminal-Bench 等 agentic 评测上接连刷新上限,把"通用对话"这条传统赛道挤成了入场券而非决胜场。Meta Superintelligence Labs 在 4 月推出 Muse Spark 1.0(43 分 AA Index)、7 月推到 1.1(51 分),并在 8 月 5 日放出 Muse Spark 1.2(54 分)和配套的终端编程 Agent Muse Code,试图在"代码 + 长时间任务"这条更窄但商业价值更高的轴上打回原形。Muse Spark 1.2 的同期关键数据来自 Artificial Analysis 的独立评测(发布于 2026-08-05),把这次更新从 Meta 单方宣传变成了可被外部验证的硬指标。
核心内容:Muse Spark 1.2 的 3 个增量与 1 个取舍
1. Agentic 知识工作显著逼近前沿,但成本曲线同步抬升。 Artificial Analysis 的 Intelligence Index 上,Muse Spark 1.2 (xhigh) 拿到 54 分,比 1.1 涨 3 分,比 1.0 涨 11 分。它与美国三号位 SpaceXAI 在分数上并列,并与 GPT-5.5 (xhigh, 55)、Grok 4.5 (high, 54) 几乎打平,仅落后 Claude Opus 5 (max, 61)、Claude Fable 5 (max w/ fallback, 60)、GPT-5.6 Sol (max, 59) 与 Kimi K3 (max, 57)。分项里 GDPval-AA v2 Elo 从 1371 拉升到 1631(+260),排到所有被测模型的第 5 名,已经超过 Claude Opus 4.8 (max, 1588);Terminal-Bench v2.1 从 78% 提到 80%;τ³-Banking 从 25% 提到 27%。代价是单任务成本从 $0.29 涨到 $0.40(基于 Meta 不变的 $1.25/$4.25 per 1M token 定价),主要因为输入/输出 token 用量在 GDPval-AA v2 上各增加约 53% 和 36%。
2. Muse Code 把"长期任务 + 子 Agent 编排"做进了默认行为。 Meta AI Research 的发布说明里把 Muse Code 描述为一个异步后台 Agent 模型,而不是传统的"一个主 Agent + 临时调度"。每个 Muse Code session 维持若干持续子 Agent(如 Photon Sphere、Embervault、Avo Lawn),它们跨任务保持存活、负责下一步动作,并自行决定何时反馈主 Agent,目标是减少重复信息收集、降低延迟、避免在长链路任务里反复被用户打断。每一次模型调用、工具执行、审批和编辑都进本地事件日志,实现 replay-exact + restart-safe:进程崩溃后,Agent 能精确接着上次的位置继续。这个设计直接把"长任务中途挂掉要重头再来"这个老问题从默认假设里删掉。/plan、/grill、/goal 三个内置 skill 分别承担"先出可审批计划"、"压力测试计划是否成立"、"朝目标推进"的职责。
3. 共训练(Kernel Optimization Case Study)与"自我改进循环"是这次训练侧的核心信号。 Meta 在发布博客里披露,Muse Spark 1.2 用 Muse Code 的 harness 轨迹做了拒绝采样训练,目标/压缩/子 Agent 的策略和 Muse Code 工具集一起进了优化配方,让模型在与 Muse Code 配对时表现最好。1.2 也大量训练于"长链路编码任务"——整仓库生成、大型端到端项目、自动研究类工作,用到规划、目标条件化、上下文压缩来维持进度。Case Study 部分:让模型在 1000+ 次工具调用(最多 24 小时)内迭代优化 GPU kernel,测试对象是 NVIDIA Hopper 上的 KDA 与 MLA kernel。基准线是 FLA 的 Triton 实现,模型被禁止直接 import 第三方 kernel 库;Muse Spark 1.2 在 KDA 上把 chunk-parallel preparation kernel 和 sequential inter-chunk scan 拼起来,在 MLA 上设计了两阶段 Triton pipeline 复用 KV latent 作为 K 和 V。
4. 取舍:科学推理小幅回调 + 事实可靠性押注"少答"。 SciCode 掉 2 点(58% → 56%),Humanity's Last Exam 掉 1 点(45% → 44%);CritPt 涨 3 点(15% → 18%)。更值得注意的是 AA-Omniscience 的 abstention 模式延续:分数 18 → 22,幻觉率 38% → 28%,但 attempt rate 从 82% 掉到 67%,accuracy 从 41% 滑到 38%。Meta 在"宁愿拒答也不胡说"这条路线上做出了第二次加注。
定价与上下文(沿用 1.1): 1M token 上下文,$1.25/$4.25 per 1M input/output tokens,缓存命中 $0.15 per 1M,首发即在 Meta 自家 API + Muse Code 同步可用(详见 https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2 与 https://artificialanalysis.ai/articles/muse-spark-1-2)。
个人评论:为什么 54 分这一档,Meta 要用"长期任务 + Agent 编排"来破
把 Muse Spark 1.2 放进 2026 H2 的坐标系里看,它不算是"分数第一"那种发布。Claude Opus 5、GPT-5.6 Sol、Fable 5、Kimi K3 都还在它前面。但 Meta 的选择是清楚的:它不在通用对话那条已经卷成红海的赛道上追 GPT-5.6 Sol,而是把"agent 任务 + 长链路编程 + 自家 harness"三件事咬成一个闭环。这里面有两条值得关注的信号。
第一条是"成本上升被默认接受"。Muse Spark 1.2 单任务成本涨 38%(从 $0.29 到 $0.40),但分项得分涨得更猛——这是把"分越高越值得"这个假设重新放回到产品决策里。如果只看 token 价格,Muse Spark 1.2 处于 GPT-5.6 Sol ($0.51)、Kimi K3 ($0.86)、GPT-5.5 ($1.18) 之下,在 50+ 段位上仍是性价比选项;但和 GPT-5.6 Sol (medium, $0.39) 比只便宜 $0.01。Meta 显然在为 agent 工作流里"为了更高成功率多烧 token"正名。
第二条是"自我改进循环 + Co-Training"被写进了发布主叙事。Meta 用 1.1 生成挑战性编码环境与指令模板,再让 1.1 自己给候选方案打分,把这种"自我对练"的产出当作 1.2 的训练数据。这条路线让人想起 Anthropic 在 Constitutional AI 阶段的自我批评循环;Meta 的版本把它推到了 coding benchmark + 长链路 Agent 这一更"工程化"的赛道上,直接对接商业化场景。
副作用是不得不提的:事实性能力下滑。AA-Omniscience 的 attempt rate 从 82% 掉到 67%、accuracy 从 41% 滑到 38%——这是 Meta 第二次在评测指标层面选择"宁愿拒答"。如果 Muse Code 这类长链路 Agent 在生产环境里越来越多地自己决策(写代码、跑测试、调 kernel),那么"模型会不会编一个看起来合理但事实错误的中间结论"就不是个学术问题,而是回归质量风险。这一点,Meta 暂时没有给出新的校准方案。
所以,Muse Spark 1.2 的真正赌注是:在 GPT-5.6 Sol、Claude Opus 5 把通用天花板顶住的这半年里,把"编程 + Agent + 长任务"这条更接近商业落地的小赛道吃下来——分数只追到 54,但每分都花在最能转化为客户付费意愿的能力上。这条路如果走通,2026 年下半年的 LLM 竞争可能就不再是"谁分高",而是"谁在自家 harness + 自家评测上跑得最稳"。
(原 Meta AI Research 发布博客: https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2;Artificial Analysis 独立评测: https://artificialanalysis.ai/articles/muse-spark-1-2)