LTX-2.5 开放权重视频模型:4K 反而在 Fast 端点,EXR 色彩管线也焊了进去

想用 LTX-2.5 生成 4K 视频?你得选那个标着「Fast」的端点,而不是「Pro」。这不是 bug:Lightricks 官方文档写得很清楚,Fast 端点用一部分保真度换取速度、4K 输出和最长 20 秒的片段,而质量优化的 Pro 端点只跑到 1080p、10 秒以内。这个反直觉的设计,恰好是理解 LTX-2.5 产品哲学的入口:它不是在卷「更大更强」,而是在把一个开放权重的视频模型,往真正的生产管线里塞。

六个端点,一次生成,声音同步

LTX-2.5 是 Lightricks 的开放权重音视频生成模型,以 LTX-2.x Community License 发布,在 fal 平台提供六个端点:文生视频、图生视频、音频生视频,各有质量优化的 Pro 与速度优化的 Fast 两个变体。所有变体默认输出同步音频,支持 16:9 和 9:16 画幅;图生视频还接受一个「结束帧」,让用户钉住镜头的落点。

规格上,Fast 变体覆盖 720p/1080p/1440p/2160p(4K),帧率 24/25/48/50fps,片段最长 20 秒;Pro 变体是 720p/1080p,24/25/50fps,片段 6/8/10 秒。参数背后的分工耐人寻味:Fast 负责快速迭代与 4K 交付,Pro 负责最终高保真输出。

画质提升的账本:算力花在哪很重要

LTX-2.5 引入 Diffusion Fidelity Rendering:把更多算力投给复杂场景,而不是平均撒到每一帧上——人群、快速运动、高密度细节在这些地方撑得住,而不是糊掉。这一特性运行在 Pro 端点上。

官方 FAQ 认为,相对 2.3 版本保真度跃升「最大的单一贡献项」是 Diffusion Video Decoder:用扩散解码器替换普通 VAE 解码,人脸更锐、屏幕文字可读、快速运动拖影更少。

叙事能力上的增量是原生多镜头(native multishot):一次生成产出多个连续镜头,角色、环境、光照、声音、风格在每次剪辑间保持一致。支撑它的是一个定制的 Gemma 4 12B 文本编码器,能在一个复杂提示词里追踪多个主体、动作、光照提示与镜头调度;Auto Duration 则在扩散开始前先「读懂」描述的动作,预测合适的片段长度。

更「工业」的一步:EXR 与 raw checkpoint

两个细节说明 Lightricks 盯上的是专业制片流程。其一,LTX-2.5 增加了原生 EXR 工作流,直接在 ACES、DaVinci Wide Gamut 等专业色彩空间内读写电影级 EXR,生成式编辑返回的也是 EXR——省掉了色彩管线中间那次有损的 8-bit 往返。

其二,是随模型一同发布的 raw pretrained checkpoint:一个未经监督微调(SFT)的基底,官方给它的定位是向新数据与新目标做激进适配——机器人、合成音视频、工业数字孪生、私有领域模型。配合 LoRA 微调(fal 平台已托管 80 多个 LTX 微调版本),「开放权重」在这里不只是「能下载」,而是「能改造」。

价格与许可证的边界

fal 平台按秒计费:Fast 变体 720p 每秒 0.09 美元、1080p 每秒 0.13 美元、1440p 每秒 0.19 美元、4K 每秒 0.30 美元,各分辨率都包含原生音频;Pro 图生视频 720p/1080p 分别为每秒 0.12/0.17 美元。

许可证方面需要泼一盆冷水:LTX-2.x Community License 不是 OSI 意义上的开源许可。它允许商业使用,但年营收达到 1000 万美元以上的实体需要先向 Lightricks 获取付费商业许可,且许可条款带有使用限制——例如不得用它训练竞争模型。

所以呢

闭源 API 视频模型拼的是「一句话出大片」的惊艳感,而 LTX-2.5 在拼另一件事:可自托管、可微调、能接进 ACES 色彩管线、能跑在自有基础设施上的资产。4K 放在 Fast 端点这个「反直觉」,本质是把高分辨率当成交付格式,把 Pro 留给画质本身——这是制片逻辑,不是 demo 逻辑。开放权重视频模型的下一轮竞争,可能不再由参数表决定,而由谁先被缝进工作流决定。

原文与模型详情见 fal.ai 的 LTX-2.5 页面