千问在 9 月 18 日悄悄把「全模态」的价格战推到下一档。Qwen3.8-Omni-Flash 上线,在 1M token 上下文里同时处理文本、图像、音频、视频输入,音频 API 价格砍掉 98%、音视频输入价格砍掉 93%。这条降价幅度直接挤压 Gemini 3.8 Flash 等 Flash 档对手的中间生存空间。
这次升级到底变了什么
官方公开 30 项评测均分,Qwen3.8-Omni-Flash 比上一代 Qwen3.5-Omni-Plus 平均提升超 26%。涨幅最高在「音视频 Agent」类:WildClawBench-MM 提升 36.5 分、AgenticVBench 提升 22.3 分,UniClawBench 取得 69.6 分。
会议场景里,AliMeeting 集 DER/cpWER 从 88.11/89.61 降到 3.35/17.18,接近数量级下降。官方声明直接写「音视频能力接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash」——这是直接对标,而非再像过去那样与 Opus 4.8 错位比较。
更受关注的是 Agentic 长音视频理解测试:OmniVideoBench 准确率从 63.4 升到 67.8,同样任务 token 消耗从 145,736 降到 79,117,降幅 45.7%。能力升 7% 时 token 砍掉近半,边际收益曲线直接反映到 API 报价上。
价格为什么砍这么狠
全模态过去几年没真正降价,核心原因是 token 爆炸:一段 1 小时会议视频按 1fps 抽帧加上音频转写,可能产生几百万 token。Qwen3.8-Omni-Flash 的解法分两层:模型内部注意力与缓存策略优化让 Agentic 长视频任务 token 砍 45.7%;同时官方同步开源 Qwen-MM-Plugins 与 Qwen-Live Harness 两件套——前者面向长程工作流的按需感知、工具调用与执行,后者面向实时持续的全模态交互——让企业可在自有场景里把模型跑在本地或私有云,而非只按公开 API 付费。对月调用量在千万 token 以上的企业来说这是决定性的。
Realtime 版:首个能「听声辨位」的开源全模态
与基础版同时发布的 Qwen3.8-Omni-Flash-Realtime 主打流式输入下的实时响应,官方称其是首个支持「听声辨位」的全模态大模型——融合空间声音与视觉信息,判断声源方向和距离。这在机器人、辅助驾驶、AR 设备上是真需求。
Realtime 版还支持实时口语陪练,联合建模发音与语义,理解受口音影响的非标准表达。这块过去是 ElevenLabs 类 TTS 厂加第三方 LLM 拼出来的方案,千问现在整合到一个模型里——对消费类 agent 产品(AI 眼镜、AI 玩具)是个值得关注的竞争信号。
自己优化自己的小样本
官方公布的优化实验里,Qwen3.8-Omni-Flash 在 12 小时内尝试提升 Qwen2.5-Omni-3B 的四川话识别能力:它自主选定评测集,经 4 轮实验构建 3413 条训练数据,最终把字符错误率从 25.79% 降到 15.30%(相对下降 40.7%)。
这并非「自我训练」,而是 Agent 加 RL 范式下「数据合成 + 模型优化」的工程化样本:模型本身调用工具生成数据,再用这些数据训练另一模型。这对做小模型微调的公司是一个直接提示——你的 1B-3B 模型接下来的瓶颈可能不在「数据够不够」,而在「Agent 能不能在你的领域自己跑出高质量合成数据」。
行业影响
全模态这次降到 1% 价位,与 GPT-5.6 调价、DeepSeek V4-Flash 砸价形成同一节奏——但全模态比纯文本/纯视觉更烧钱,Flash 档的「保本价」过去被认为很难再破,现在 Qwen3.8-Omni-Flash 直接掀桌。短期看,Gemini 3.8 Flash 跟 Claude Sonnet 5.5 必须给出一个回应——不是「能不能做」,而是「能不能做到同样便宜」。中期看,这个价格段会推动全模态从「demo 级」走向「产品级」,以前一个 AI 眼镜项目要把全模态塞进 200 美元 BOM 会被算力与 API 成本卡住,现在可以重新做预算。
所以呢
做 AI 眼镜、辅助驾驶、机器人或全模态 Agent 的,值得把 Qwen3.8-Omni-Flash + Qwen-MM-Plugins + Qwen-Live Harness 整套拉到新分支重新评估——它不仅是能力变强,更是单价首次进入「可以默认进入产品配置」的区间。做 Flash 档竞品的,接下来几周内必须拿出一份回应价格策略,而不是等下一份 benchmark。