蒸馏换价格,1080p 单秒 0.14 美元
xAI 这次没有发新架构,而是把现役旗舰 Grok Imagine Video 1.5 蒸馏成了 Lite 版。蒸馏(student model 学大模型行为)的代价是质量略降,但换来的是更便宜和更快。OpenRouter 模型卡写得直接:Lite 是一个"在速度与价格上做了取舍,1080p 实际由 720p 渲染再升频"的视频生成模型。
价格表非常激进:480p 0.02 美元/秒、720p 0.03 美元/秒、1080p 0.14 美元/秒。同档 1080p 摆到一起:Veo 3.1 含音频版 0.40 美元/秒,Lite 比 Veo 3.1 便宜 65%,也比完整版 1.5 的 0.25 美元/秒便宜 44%。60 秒总素材成本:Lite 1080p 是 8.40 美元,完整版 1.5 是 15 美元,Veo 3.1 是 24 美元。
比 Veo 3.1 高两个名次,落在两条 Pareto 前沿上
Artificial Analysis 在 AA-Video-T2V v2.0 与 AA-Video-T2V-Silent v2.0 两张榜上把 Lite 排在第 17 位,刚好高出 Veo 3.1 两位。AlphaSignal 的报道进一步指出,Lite 同时落在质量-速度前沿和质量-价格前沿,也就是说在它所在的层级里,目前没有其它模型能同时压更低延迟和更低价格。
中位生成延迟 60.5 秒(产出 10 秒 1080p 素材),这个量级足以支撑迭代式 prompt 调试与故事板工作流。横向参考:Kling 3.0 1080p Pro 质量略高一档但 94 秒才能渲染 5 秒片段;Vidu Q3 Turbo 的 5 秒 720p 配置快约 9 秒,但质量评分明显更低。
强项在多镜头叙事,短板在唇同步与人体
按 AA-Video-T2V 的十项能力细分,Lite 最接近前沿的是多镜头与叙事(Multi-Scene & Narrative)、光照与材质(Lighting & Materials)、文字渲染(Text Rendering),与完整版 1.5 之间的差距也最小。
短板集中在对话与唇同步(Dialogue & Lip Sync)以及人体解剖(Human Anatomy)。用例层面,它在建筑与房地产、消费内容、生产力与知识工作(产品走查、室内漫游、虚拟陈设、社交短视频、b-roll、解释视频、教育素材)这几类里表现最好。Live-Action Film 和榜单的 Frontier 类目是它的明显短板——对话密集、对人脸/手部要求高的镜头,生产用之前得做针对性 prompt 评测。
1080p 是 720p 升频,选型时要看清
OpenRouter 模型卡特别强调:Lite 的 1080p 输出其实是 720p 渲染后再升频,帧尺寸 1080p 但原生细节来自 720p。细纹理、小字、裁切和合成场景,这层差异会显形。第三方目录有的只暴露 480p/720p 两档,依赖 1080p 细节的应用需要把 Lite 的升频输出与完整版 1.5 在自家 prompt 集上做对比。
实用工作流建议
Lite 不是用来替代 1.5 的,而是用来"做草稿"。10 条 1080p Lite 草稿成本 14 美元,挑一条用完整版 1.5 重生成一次 2.50 美元,合计 16.50 美元;直接用完整版 1.5 跑 10 条是 25 美元。把草稿档切到 720p,10 条草稿 3 美元,加一条完整版 1080p 2.50 美元,合计 5.50 美元。
Lite 的基准画像最贴合建筑漫游、解释视频、社交短视频、b-roll 和多镜头草稿,需要同步对话、对人体敏感的特写、要求高的实拍场景时,完整版 1.5 或更强专用模型仍然应该顶上。
Veo 3.1 是被压着打的对手
数字摆出来很直白:同档 1080p,Lite 比 Veo 3.1 含音频便宜 65%,榜单名次比 Veo 3.1 高两位,中位渲染延迟 60.5 秒。视频生成市场的中价位段——基础工具与前沿旗舰之间的缝隙——正在被 xAI 用 Lite 这一档压下来。
Veo 3.1 走"含音频、长上下文"路线,Veo 3.1 Fast 走更便宜的另一档;xAI 的 Lite 则直接压在 Veo 3.1 名次之上,价格却只有它的 35%。AA-Video-T2V v2.0 的排名本身依赖一组特定 prompt、评分方法和模型快照,生产环境的真正结论还得叠上各路由可用性、失败作业处理、排队延迟、音频质量以及自家 prompt 集上的实测。Lite 已经把"同价位最便宜 + 同价位最快"这件事做出来了,接下来要看的是生态侧——fal、Vercel AI Gateway 这些分发渠道能不能把它快速带到开发者的实际工作流里。