8 月 14 日,小红书旗下的 dots studio 把 dots3 家族的第一个开放权重模型 dots3-note preview 挂上了 Hugging Face:280B 总参数、16B 激活的 MoE,上下文直接给到 512K token,许可证是 Apache 2.0。内容平台亲自下场做开源基座模型,这件事本身就值得看一眼。
核心规格:一杯"总参很大、激活很省"的 MoE
根据官方 model card,dots3-note preview 的架构配置如下:
- 架构:多模态 MoE,1 层 dense + 45 层 MoE,hidden size 5120;
- 专家配置:256 个路由专家 + 1 个共享专家,top-8 路由,280B 总参数、16B 激活参数;
- 注意力:13 层 DSA(Top-2048)+ 33 层滑窗注意力(SWA),配比约 1:3;
- 上下文:512K token,词表 152K;
- 多模态输入:视觉编码器是 MoE ViT(7B 总参、1.2B 激活),音频编码器为 800M dense,支持文本、图像、视频、音频四路输入、文本输出;
- MTP:1 层共享层(1.13B),用于投机解码;
- 精度:BF16 / FP8。
官方将其定位为"家族中最轻量的成员"——dots3 家族设计上会包含能力、延迟、推理成本不同取舍的多个模型,note preview 只是第一张牌。
官方自报评测:编码与多模态都有交代
model card 提交到 Hugging Face 的评测数字包括:SWE-bench Verified 78.4、SWE-bench Multilingual 75.7、SWE-bench Pro 61、MMMU Pro(标准 10 选项)79.1、WildClawBench 61.7、Claw-Eval 73.4、HLE 52.6、Apex Agents 30.8。
需要强调:这些均为官方自报数字,第三方复现还要等。但单看分布,它的叙事重心很清楚——编码 agent 与多模态理解两条腿,而不是纯刷通用推理榜。
部署:工程协同做得相当前置
FP8 checkpoint 在单个 8 卡 GPU 节点即可跑,vLLM main 分支已原生支持,SGLang(#33829)和 Transformers(#47844)的 PR 还在评审中,官方同步提供了 SGLang Docker 镜像和 vLLM 部署配方。MTP/NEXTN 投机解码是可选项,官方称可将 TPOT 降低超过 50%。ModelScope 同步上架,OpenRouter 上也提供了免费入口。
推理框架在发布日就齐动,说明这不是"权重一扔就跑"的开源,工程协同是提前做好的。
几点判断
第一,16B 激活是这类模型真正的卖点。 280B 总参听起来吓人,但 MoE 的推理成本由激活参数决定,16B 激活把它压进了中杯价位。配上 512K 上下文和多模态输入,model card 明确列出的目标场景是工具调用、多步 agent 工作流和交互式任务——这是照着 agent 时代的接口设计的。
第二,"note" 和 "preview" 两个词都值得抠。 家族最轻量成员 + 预览版,意味着 dots studio 在用小杯探路:先看社区反馈和推理栈适配,再决定后面大杯怎么发。
第三,内容平台做基座模型,语料是别人没有的牌。 小红书手握真实、海量的图文与视频多模态数据,dots3-note 的视觉编码器做成了 MoE 结构,大概率是为这种异构输入准备的。Apache 2.0 + OpenRouter 免费试用,把开发者尝试的门槛压到几乎为零。
所以呢
对中国开源模型序列来说,这只是又一行加号;但对"谁有资格做开源多模态基座"这个问题,小红书交出的答卷是:有真实多模态语料的内容平台同样可以上桌。对开发者而言,趁 preview 免费去 OpenRouter 上跑几个自己的 agent 用例,是当下成本最低的验证方式——第三方复现数据出来之前,自己的负载就是最好的 benchmark。