7B 模型在数学推理和智能体搜索上跟 235B 级旗舰掰手腕,还把从预训练到后训练的全部权重、数据、训练日志一股脑开源——这不是哪家大厂的发布会,而是学生兴趣组 ZGCAGI 交出的 ZGCM-1。论文(arXiv:2609.13356)9 月 11 日提交,9 月 15 日冲进 Hugging Face Daily Papers 前三,290 个赞。

核心赌注:参数不够,工具来凑

ZGCM-1 的前提很直白:小模型背不下整个开放互联网,与其硬塞,不如让模型「想清楚再动手」——把内部思考与外部工具调用耦合起来,突破参数容量天花板。落成的形态是一个 7.39B 参数的 dense 模型,从零训练,支持 256K 上下文,单一模型内同时提供思考与直答两种模式。

训练配方:三处狠活

其一,架构与系统协同设计:门控滑窗注意力与全注意力交错排布,搭配稳定的 FP8 Muon 优化器。其二,渐进课程加 MDP 中训练:上下文按 16K、64K、256K 三级拉长,交互轨迹被重构成马尔可夫决策过程喂进模型,让「会调工具」长在训练阶段而不是后补。其三,AI 原生研发流:agent 蜂群自主管理集群运维、数据清洗与快速诊断评估——训练模型这件事本身也被 agent 化了。

自评战绩:先留一分怀疑

按论文摘要,通用基准上 ZGCM-1-7B 在 7B 档位有竞争力;在若干数学推理与智能体搜索套件上,与 Qwen3-235B-A22B、GLM-5.1 这类大一个数量级的前沿模型「保持竞争力」;预训练设计在 16K time-to-loss 上带来约 4.2 倍效率提升。团队还提炼了八条经验,覆盖架构扩展、SFT 质量剪枝、长上下文泛化与智能体协同训练动态。注意:以上全部是作者自报,competitive 是个弹性很大的词,独立复现之前别急着下结论。

「全开」到底开了什么

HF 组织页放出 6 个模型仓库:预训练、课程预训练、16K/64K/256K 三档中训练检查点、最终的 ZGCM-1-7B,外加 5.44B 行的 ZGCM-1-Data 数据集、训练代码、分阶段数据配方与 W&B 日志。ZGCAGI 自我介绍为由中关村学院与中关村人工智能研究院学生组成的特别兴趣组——一个学生组织,把「从零训基座」的完整工程现场直接公开。

我的看法

这个工作真正值得盯的不是跑分,而是路线宣言:7B + 工具 + 256K 上下文,赌的是「能力靠外挂,不靠参数堆」。这条路若跑通,中小团队就不必陪跑参数军备竞赛。另一层信号更扎眼:学生兴趣组能从零训出这个完成度的模型并全链路开源,说明「训一个能打的基座」正在从巨头专利滑向课题作业量级。

而当运维、数据、评估每个环节都能交给 agent 蜂群时,下一个问题不再是「谁能训」,而是「还剩什么必须人来训」。