SparkLLM 团队(XHToken)把 Spark-X2.5-4B 和 1.7B 同步推上 Hugging Face,Apache 2.0 开源。4B 这个量级,过去默认是「能跑但别期望太多」的玩具。这次给的实测表里,Spark-X2.5-4B 在 22 项 benchmark 的 15 项上超过 Qwen3.5-4B、Qwen3.5-9B、Gemma4-12B 同级对手。这不是简单刷榜,是端侧 agent 工作流真正可以用的拐点。

架构:hybrid attention + 原生 1M 上下文

模型卡说清楚 hybrid attention:每 4 层里 1 层做 full attention,剩下 3 层用 sliding window attention(SWA)。full 层负责跨段语义,SWA 层压住 KV cache 爆炸。Spark-X2.5 直接给出原生 1M token 上下文,是从训练后期拿百亿级 1M 长度样本专门 stage 训出来的。Qwen3、GLM-5.3 走的也是这条路,但 SparkLLM 把这件事压到了 4B 端侧可跑的量级。

训练:20T 预训练 + MOPD 合并多能力 RL 教师

预训练 20T token 是头部开源 LLM 的标配。post-training 走 SFT 起步 + 大规模 RL 收尾,最后用 MOPD 把几个能力域的「教师策略」合并回一个可部署模型。「多能力 RL 蒸馏合并」是 2026 年开源端侧模型标准动作。

Agent benchmark 翻倍

τ³-bench 上 30.4(Qwen3.5-4B 是 6.7),BrowseComp 40.9(Qwen3.5-4B 14.3),MCP-Atlas 54.6(Qwen3.5-4B 40.8),Workspace Bench 31.2(Qwen3.5-4B 21.3)。这些是「多步工具调用 + 长时规划 + 跨 app 工作流」的代理评测,不是 MMLU 问答测试。SWE-Bench Pro 44.4 对 Qwen3.5-4B 29.4 也明显拉出差距。所有评测都开了 thinking mode,温度 1.0、top_p 0.95。

推理端:vLLM/SGLang/llama.cpp/MLX 全栈支持

vLLM、SGLang、llama.cpp、MLX 都已支持,NVIDIA、华为昇腾、Hygon、HOUMO.AI 都能跑,Ollama 和 LM Studio 也接好。官方写的「superior TTFT, TOPT」是合规的「同级最优」措辞。

4B 跑 1M context 不再是营销话术

Qwen3-4B-Instruct 那一代「1M context」基本是位置编码插值 + 检索增强的合成数字,实际可用窗口在 32K-128K 之间就掉得厉害。Spark-X2.5 训练阶段 push 到 1M 序列长度,加上 hybrid attention 把 KV cache 砍掉 ~3/4,意味着 4B 模型在 64GB 内存的 Mac Studio 上可以真正维持 1M 上下文做 agent 工作流。配合 NVIDIA/华为昇腾两条路,端侧 agent 的硬件门槛被压低一档。

要给开源端侧模型排个 2026 第四季度的「值得看」清单,Spark-X2.5-4B 一定在前列。看社区怎么基于它做 fine-tune,以及那 22 个 benchmark 之外的真实工作流扛不扛得住。