中国电信的 AI 子公司把 TeleChat 系列的下一代模型直接开源了:9 月 17 日,Xing4.0-29B-A4B 权重同步上架 Hugging Face、ModelScope 与 Modelers 三个平台,附带 FP8 和 GGUF 量化版本,Apache-2.0 许可证,组织名为 XingChen-AGI。
29B 总参、4B 激活的高稀疏 MoE
架构上这是一颗典型的高稀疏 MoE:29B 总参数、每 token 仅激活 4B;64 个路由专家每 token 取 4 个,外加 1 个共享专家;注意力用 MLA,40 层,hidden size 3584。上下文原生 256K,可扩展到 512K。官方将其定位为 agent 导向,架构组合写作 mHC + MLA + MTP,其中 MTP 在官方给出的 vLLM 启动命令里被用作投机解码方法。
真正的看点:昇腾全栈训练
模型卡里最重的一句声明是:Xing4.0-29B-A4B 是该规模上首个完全在昇腾 NPU 平台、用 MindSpore 框架训练的模型(官方口径,单一发布方声明)。训练在昇腾 910C 集群上进行,通过细粒度 MoE 通信优化、选择性重计算、DVM 自动图算融合与昇腾 C 融合算子的多层协同优化,整体训练吞吐比开箱配置提升约 96%。这组数字意味着国产算力栈进入了深度调优阶段——README 里还专门致谢 DeepSeek 团队的架构设计带来的稳定性与效率。
跑分:agent 场景是主场
官方提交的评测里,Xing4.0-29B-A4B 在 SWE-bench Verified 拿到 75.0,对比 Gemma4-26B-A4B 的 53.0 与 Qwen3.6-35B-A3B 的 76.0;Terminal-Bench 2.1 拿 57.5,明显超过两个对手的 30.0 和 51.5;SWE-bench Multilingual 66.0,Claw-Eval 76.55,DeepresearchBII 60.80。数学与工具调用上互有胜负:AIME2026 为 90.0,低于 Qwen3.6 的 92.7;Tau3-Bench 64.63,同样略低于 Qwen3.6 的 67.2。以上均为官方自报口径,评测配置(温度、上下文窗口、运行次数)在模型卡脚注里逐项列明。
生态位:框架 PR 还没合入
部署侧覆盖 vLLM、SGLang、KTransformers,微调支持 LLaMA-Factory 与 MindFormers,并对 OpenCode、Claude Code、OpenClaw、Hermes 等 agent 框架做了格式对齐;但要注意,SGLang、vLLM、TensorRT-LLM、llama.cpp、KTransformers 五个框架的支持 PR 截至开源时全部处于待审状态,短期部署需要走 PR 分支。社区反应尚在早期:上架两天,HF 显示近 30 天下载 7,278 次,GitHub 65 star,已出现 6 个微调版本与 7 个量化版本。
对运营商背景的团队来说,这是把「自研大模型」从新闻稿推进到可复现工件的一步;对行业来说,昇腾栈上跑出这个规模的 MoE,比跑分本身更值得盯。模型卡与权重见 Hugging Face。