LongCat-Next:把文字、图像和声音都改写成同一种“下一 Token 预测”

多数多模态模型的统一,停留在入口层:图像走视觉编码器、声音走音频模块,最后再把特征接进语言模型。美团 LongCat 团队开源的 LongCat-Next,选择了更激进、也更简单的一条路——把文本、视觉和音频都离散化到共享 Token 空间,再用同一个自回归目标处理理解、生成与对话。

项目把这套方法称为 DiNA(Discrete Native Autoregression)。它不是为每种模态分别设计一套主干,而是为不同模态配备 tokenizer 与 detokenizer,让成熟的“大语言模型训练基础设施”直接扩展到视觉和音频。底座采用 LongCat-Flash-Lite MoE,项目将模型规模标为 A3B,并把它定位为同时覆盖“看、创作、说话”的原生多模态模型。项目说明与代码见 GitHub

离散视觉为什么是核心

这条路线最难的部分,不是把图片切成 Token,而是让离散 Token 同时保存“它是什么”和“它长什么样”。LongCat-Next 将 Semantic-and-Aligned Encoders(SAE)Residual Vector Quantization(RVQ) 结合,构造分层视觉 Token:前者负责语义抽象,后者保留细粒度视觉信息。

团队还提出 dNaViT(Discrete Native-Resolution Vision Transformer)。它把视觉特征处理成类似“视觉词”的离散接口,支持动态 Token 化和反 Token 化,并适配原始分辨率。项目给出的判断是,视觉理解与视觉生成不必由两套彼此割裂的架构完成,它们可以被重新表述为同一个预测过程的两种输出。

这一设计的工程意义很直接:模型不再只是“语言模型外接视觉插件”,而是让模态信号进入同一套离散嵌入空间。README 还指出,即便视觉表示采用 28 倍压缩率,模型仍保持较强的生成质量,尤其强调了文字渲染;音频侧则覆盖语音理解、低延迟语音对话和可定制的声音克隆。

开源不只给权重,也给训练入口

LongCat-Next 的模型权重与代码采用 MIT License。仓库给出了文本、图像理解、图像生成、音频转文字、音频生成和语音合成示例,同时提供基于 PyTorch FSDP2 的监督微调代码。SFT 支持“图像+文本到文本”、文本到图像,以及混合样本的统一训练。

部署门槛也写得很清楚:Transformers 方案至少需要 3 张、每张 80GB 显存的 GPU,示例指向 H100 或 A100 80GB;推荐环境包括 Python 3.10 及以上、PyTorch 2.6 及以上、Transformers 4.57.6 及以上。项目还提供了 SGLang 的基础适配,但把更完整的部署支持放在单独的推理仓库中。

这意味着它当前更像研究与工业验证底座,而不是一键运行的消费级模型。它的价值也不只在某一项榜单成绩,而在于验证一件事:离散 Token 是否足以成为文本、图像和声音的共同语言。 如果这条路线继续成立,多模态系统的复杂度可能从“不断增加专用模块”,转向“把 tokenizer、表示空间和统一训练做得更好”。

LongCat-Next 给出的答案很明确:多模态的下一步,不一定是接更多模块,也可能是先把所有模态都变成模型真正能内化的“词”。

预测

  • 发布前判断:技术信息密度高,但主题偏底层架构,预计收藏价值高于评论热度。
  • 风险点:A3B、RVQ、dNaViT 等术语会抬高阅读门槛;标题中的“同一种下一 Token 预测”是主要点击钩子。
  • 不变更说明:本预测在发布前写入,后续不根据阅读数据修改。