8月31日,DeepSeek 把 V4 家族第一个多模态实验模型 DeepSeek-V4-Flash-Vision-Exp 的权重放上了 Hugging Face——距离它以 API 形式上线(8月21日)只过了10天。305B 参数、MIT 许可证,附极简 PyTorch 推理参考实现。权重开放之后最值得做的事,是把官方那张 11 项基准对照表逐项重读一遍:哪些是真反超,哪些其实没有。

3 项反超 Opus,但不在 Chartography

模型卡的三方对照(Vision-Exp / 前代 0731 文本版 / Anthropic Opus-4.8)覆盖 7 项文本 agent 基准与 4 项多模态基准。逐项核对,Vision-Exp 真正压过 Opus-4.8 的只有 3 项:文本侧 DeepSWE 59.3 对 58.0;多模态侧 ZeroBench(Pass@5)35.0 对 34.0、Agents' Last Exam 27.3 对 25.7。

而常被引用的 Chartography 实际是 64.3 对 65.0——Opus 以 0.7 分领先;ApexBench(Pass@1)36.5 对 39.4 同样 Opus 领先。文本侧 Terminal Bench 2.1(83.9 对 85.0)、NL2Repo(57.7 对 69.7)、Cybergym(75.3 对 78.3)、DSBench-Hard(63.6 对 71.7)也都是 Opus 占优。差距是结构性的:纯文本重任务 Opus 仍领先,视觉相关与 SWE 场景 Vision-Exp 开始咬住甚至反超。

与前代 0731 相比,文本侧 7 项里 6 项提升:DeepSWE 从 54.4 到 59.3、Toolathlon-Verified 从 70.3 到 75.9、DSBench-Hard 从 59.6 到 63.6、Terminal Bench 2.1 从 82.7 到 83.9,唯一微降的是 Cybergym。多模态侧跃升更猛:ApexBench 从 26.2 到 36.5——表格脚注注明 0731 在这项忽略了输入中的多模态元素,这 10.3 分正是「装上眼睛」的直接收益。

权重仓库里还有什么

参考实现覆盖视觉编码器、aligner、DFlash 注意力、MoE、Hyper-Connections 和 DSpark 前向路径——组件名对应 DeepSeek 自家今年的注意力工作,非现成模块缝合。评测配置透明:DeepSeek Harness minimal 模式、max 推理强度、temperature = 1.0、top_p = 0.95。

部署给到命令行级:vLLM 一条 docker 命令可在单台 4×GB300 节点起服务,默认开 DSpark 投机解码(3 个投机 token);SGLang 侧草稿与目标权重同源一份 checkpoint,无需单独 draft 模型。生态跟进快:上线约两天月下载 17,893,已有 2 个微调、8 个量化版本,llama.cpp/LM Studio/Ollama 入口就位。

对开发者的所以呢

API 阶段的跑分只能听官方一面之词;权重落地后,任何人都能在相同配置下重跑这张表——包括亲手验证到底哪几项反超。MIT 许可证没有商用顾虑。下一个信号:Exp 后缀去掉之时,大概率就是 V4 家族多模态正式版的发布日。

参考:huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 模型卡;theopenweights.com/news/deepseek-v4-flash-vision-exp-2l4q