DeepSeek-V4-Flash转正:这次升级不靠换架构
DeepSeek在7月31日更新API日志,宣布DeepSeek-V4-Flash正式版进入公测。开发者不需要改接口,只要把模型名设置为 deepseek-v4-flash,就能调用最新版本。
这条消息最值得注意的地方,不是又多了一个模型名字,而是官方明确说:V4-Flash-0731与此前的V4-Flash-Preview保持相同的模型架构和规模,只重新进行了后训练。换句话说,这不是一次重新训练底座、扩大参数规模的升级,而是把重点放在模型如何完成任务上。
从官方公布的结果看,提升集中在智能体和代码Agent场景。V4-Flash在Terminal Bench 2.1上得分82.7,NL2Repo为54.2,Cybergym为76.7,DeepSWE为54.4,Toolathlon verified为70.3。官方还公布了Agent Last Exam、Automation Bench和DSBench等测试结果,其中DSBench-FullStack为68.7,DSBench-Hard为59.6。需要说明的是,后两项是内部测试集,不能简单和公开榜单横向比较。
这组数据透露出一个变化:大模型的竞争焦点正在从“会不会回答”转向“能不能把事情做完”。终端操作、代码仓库修改、工具调用和多步骤任务,考验的不是单轮答案漂亮不漂亮,而是模型能否规划、执行、检查,再根据错误继续修正。对于Agent来说,后训练往往比单纯增加参数更直接,因为它优化的是行为路径和任务习惯。
V4-Flash还原生支持Responses API,并针对Codex做了适配。这个动作的意义在于,模型不再只是一个聊天接口,而是在主动接入开发者已经使用的Agent工作流。接口兼容降低了迁移成本,Codex适配则把模型能力直接放到代码生成、终端执行和项目维护的实际链路中。
当然,benchmark不能等同于真实生产力。官方测试使用了特定的Harness、最大努力等级和固定采样参数,开发者自己的代码库、工具权限、上下文长度和失败处理机制,都可能让结果发生变化。尤其是Agent任务,模型本身只是一个环节,工具编排、沙箱安全和结果验收同样重要。
我的判断是,DeepSeek这次更新的信号比一次普通的版本迭代更清楚:下一轮模型竞争未必靠更大的底座取胜,而可能靠更好的后训练、工具接口和任务闭环。对开发者来说,值得测试的不是它在聊天榜单上排第几,而是它能否在自己的仓库里少返工、少中断、少需要人工接管。
如果一个模型不换架构,只靠后训练就能把Agent能力拉上去,那么未来真正拉开差距的,可能不是参数表,而是模型对工作流的理解深度。