统一多模态模型正在成为开源社区的新前线:一套权重同时完成理解和生成,不再把视觉编码器外挂在文本骨干上。商汤近期把 SenseNova-U1.5-8B-MoT 正式版放上 Hugging Face(开源动态站 theopenweights 于 8 月 19 日收录),8B 名义参数、Apache 2.0 许可证,还把 SFT 和 RL 两个阶段的 checkpoint 一起开源(模型卡见 Hugging Face)。

先说架构:原生统一,不是拼装

theopenweights 在收录这条发布时的评价很准:U1.5 的做法是「把不同模态当作一等公民,而不是往文本骨干上焊一个视觉编码器」。它基于商汤的 NEO-unify 原生统一多模态架构——这条线可以追溯到今年 5 月发布的 SenseNova-U1 论文(arXiv:2605.12500),7 月底先放出 Preview 版,8 月中旬转正。

按照官方模型卡的说法,正式版在 NEO-unify 基础上强化了五个环节:patchify 层、数据质量与分布、任务形式化、prompt 增强和后训练管线。翻译成人话:图像被切成 patch 序列与文本一起进入同一个骨干,生成与理解共享同一套表征,编辑则是这个统一表征的自然延伸。

六项升级,两个 checkpoint

官方给正式版列了六项用户可感知的改进:

  • 图像生成质量:构图与色彩和谐度、材质真实感、自然光照与局部细节;
  • 中英文文字渲染:海报、信息图等文字密集设计里信息层级更清晰;
  • 原生 4K 生成:高分辨率输出更稳定,生成效率也有提升——示例推理脚本直接给到 2048×2048;
  • 图像编辑更可靠:局部、文字、多参考、插入与替换等编辑模式下,主体身份和未编辑区域保留更强;
  • 复杂指令遵循:物体计数、空间关系、布局、风格等多约束单请求执行更一致;
  • 视觉控制:通过边界框、视觉标记和多图参考做区域级、对象级控制。

工程侧的信息也够透明:上游环境 Python 3.11 + PyTorch 2.8 + CUDA 12.8;权重表里同时挂着 SenseNova-U1.5-8B-MoT(RL 阶段)和 SenseNova-U1.5-8B-MoT-SFT(监督微调阶段)两版。把 SFT 中间产物一并放出,意味着社区可以拿它当起点自己走后训练。一个值得注意的细节:模型名叫 8B,HF 页面元数据标的模型大小是 18B 参数(BF16)——统一架构里生成与理解模块合计的统计口径与命名口径并不一致,部署前值得自己核一遍显存。

模型卡里最罕见的部分:自曝短板

大多数模型卡把局限藏在一行免责声明里,U1.5 的正式版模型卡却单开了一节「Ongoing Improvements」,列了五类已知问题:部分 prompt 会产生过度高频细节或过饱和颜色(官方提示降低 cfg_scale 可缓解);密集、小字号或中英混排文字可能出错;强约束布局里的精确计数与对齐不完美;小脸、手部、四肢等细节仍不稳定;跨多区域、多轮、多参考的复杂编辑可能漂移。

这种写法对采用者是实打实的节省:你可以拿着这份清单直接判断自己的场景是否踩雷,而不是部署之后才发现。社区承接的早期信号也已经出现——HF 页面显示过去一个月下载量 2,682 次,衍生出 8 个微调、3 个量化版本和 3 个 adapter,另有一个免费在线试用的 SenseNova-Studio playground。

所以呢

统一多模态的竞争已经从「有没有」进入「多大、多便宜、多可用」。前沿实验室在万亿参数上卷生成卷编辑,商汤这一手卡的是另一个位置:8B 级别、Apache 2.0、双 checkpoint,让一张消费级卡就能跑的团队也能进场搭视觉生成管线。自曝短板的模型卡未必是营销加分项,但它把「能不能用在我的场景」的判断成本压低了——这比跑分图里领先零点几分更有用。

下一个值得观察的问题:SFT checkpoint 开放之后,社区微调能不能先于官方修掉那五类短板?