智谱今天在官方技术博客公开了国内大模型厂商里的第一个 RSI(Recursive Self-Improvement)工程实践:他们让 GLM-5.3 驱动的 Infra Agent,从零搭建并优化了 GLM-5.3-Flash 的整套生产级推理服务。生产环境跑在 10 万张以上国产 AI 加速器上,不到两周端到端吞吐就做到了初始基线的 3 倍,硬件利用效率和单 token 成本对齐了主流 NVIDIA GPU 的水平。

RSI 的字面意思是「递归自我改进」——模型不断优化自己运行的系统,再由这套系统去支撑下一代模型的训练,听起来离现实很远。但智谱这次给出的案例说明:早期形态已经在生产环境里跑通了。

要把一个新模型从「在国产硬件上第一次跑通」推到「能扛生产流量的高吞吐服务」,历来是几周甚至几个月的系统工程。智谱这次的难点在于三件事叠加:芯片显存与带宽受限、要支持 1M token 上下文和图文多模态、生态不成熟、kernel 支持残缺。能跑出这个成绩,是因为 Infra Agent 承担了过去由基础设施工程师手工完成的大部分工作。

关键机制:把工程师经验拆成「可归因的反馈」

团队把核心创新归结为一套他们称之为「dense feedback」的反馈机制,不是堆日志、堆 metric,而是让每一条反馈都能归因到一个具体的引擎参数、代码改动、kernel、输入条件或代码路径。三类反馈对应三类决策:正确性反馈告诉智能体「算的对不对」,系统行为反馈定位「时间花在哪」,性能反馈回答「哪种方案更好」。这三层组合起来,把过去依赖资深工程师经验串联起来的诊断过程,变成智能体可以连续执行的工程闭环。

博客给了三个具体案例。

案例一:把 KDA kernel 的累积误差修回容差内

智能体通过对比并行与非并行 kernel 的输出,发现 KDA kernel 的 Context Parallelism 路径在状态合并时累积误差。根因是 tl.dot 默认走 TF32,把输入精度从 tf32 改成 tf32x3 之后误差被压回容差内。这条修复已经合并到 Flash Linear Attention 的 PR #1180。

案例二:补一个 GIL 释放,KV Transfer 差距从 20% 压到 1%

Prefill + KV Transfer 的吞吐和 Prefill-only 的差距超过 20%,远超 5% 的目标。智能体沿着时间线追到 DeepEP v1.2.1 的两个 C++ 函数没有显式释放 GIL,把同一进程里的 Mooncake Transfer 提交线程堵死。补上 GIL 释放后差距压到 1% 以下。

案例三:合并沿 V 维的冗余 tile,单 kernel 提速 1.71 倍

智能体从 SGLang、Flash Linear Attention、DeepGEMM 等开源 kernel 里提炼出「优化骨架」,再结合 profiling 重新评估 tiling、内存访问与资源分配。在 KDA Decode kernel 上,靠合并沿 V 维的冗余 tile,单 kernel 拿到 1.71 倍提速。

真正的信号

智谱在博客里承认:选目标、设边界、做风险评估仍然是人。但 2 周、3 倍吞吐、10 万张国产卡,这三个数字说明一件事——模型优化系统、系统跑模型,这条循环一旦在生产里跑顺,前沿模型迭代对底层工程团队规模的依赖会迅速下降。这才是 RSI 真正值得关注的信号。