LTX-2.5:22B参数开源视频生成模型发布

近期,一款参数规模达220亿的音画生成模型正式对外开源,该模型可根据文本、图像或视频输入生成同步匹配的音视频内容。作为LTX-2系列的最新迭代版本,其在原有基础上升级了视频解码、提示词理解与蒸馏流程,新增了原生多镜头生成、自动时长预测、4K HDR与RAW工作流等多项能力,同时提供面向微调开发的完整权重与固定步数推理的轻量化版本。
相关模型与部署资源可通过以下平台获取:
- 开源模型社区:https://modelscope.cn/models/Lightricks/LTX-2.5
- 代码托管平台:https://github.com/Lightricks/LTX-2
- 官方项目博客:https://ltx.io/model/ltx-2-5
核心功能升级
新版本替换了此前使用的VAE重建阶段,采用全新的Diffusion Video Decoder来将视频潜变量还原为最终输出画面,重点优化了人脸细节、纹理清晰度、画面文字呈现以及运动画面的稳定性。官方展示的越野摩托涉水案例中,该解码器有效处理了高速运动的主体、飞溅的泥点、积水反光以及跟随镜头带来的画面变化,大幅减少了动态场景中的视觉瑕疵。
LTX-2.5支持在单次生成任务中组织多个衔接连贯的镜头,在切换镜头后仍能保持人物、环境、光照、声音以及整体视觉风格的一致性。官方以极光下的探索者场景为例,展示了同一段视频内不同景别切换与镜头过渡的自然效果。
模型搭载了定制的Gemma 4 12B文本编码器,并加入了Prompt Enhancer模块,可以处理包含多人物、动作指令、镜头运动要求、光照设定等复杂的描述内容,有效减少长提示词中的指令遗漏问题,提升复杂场景的生成准确率。
新版本新增了可选的Duration Predictor模块,当用户未手动指定生成帧数时,模型可以根据提示词中的动作描述自动判断所需的视频时长,再匹配对应的生成帧数,让镜头长度与动作节奏更加适配。
官方还推出了面向专业后期制作的原生4K HDR与RAW/EXR工作流,支持调色、合成等专业后期环节。需要注意的是,本地生成可达到的分辨率、生成速度与显存占用情况,会根据选用的权重格式、解码器、上采样流程以及硬件配置有所不同。
技术实现细节
新版本的多项升级背后,依托了多项核心技术优化:
全新扩散视频解码器
通过Diffusion Video Decoder替代传统VAE重建流程,不仅提升了画面细节与运动稳定性,权重包中还提供了速度优先的卷积VAE选项,用户可以根据画质、生成速度与显存占用的需求灵活选择解码方式。
提示词增强与自动时长预测
定制的Gemma 4 12B文本编码器搭配Prompt Enhancer模块,可以将复杂的用户提示词转换为模型可识别的条件信息。新增的Duration Head模块则可以根据提示词中的动作描述预测所需的生成帧数:当未指定num_frames参数时,自动确定视频片段长度;若用户手动指定帧数,则按照设置生成内容。需要注意的是,手动指定的帧数需要满足num_frames % 8 == 1的要求,同时视频的宽度和高度需能被32整除。
Diffusion Fidelity Rendering渲染策略
LTX-2.5引入了Diffusion Fidelity Rendering技术,可以根据场景的复杂程度动态分配渲染计算资源,在控制整体计算开销的同时,保证逐帧的像素输出质量。
开源权重版本说明
本次开源的模型提供了多种不同规格的权重版本,以适配不同的使用场景:
| 权重名称 | 功能说明 |
|---|---|
| ltx-2.5-22b-dev-transformer-bf16 | 完整模型,适用于高质量生成流程与模型微调 |
| ltx-2.5-22b-distilled-transformer-bf16 | 固定8步推理的蒸馏版模型,CFG=1 |
| ltx-2.5-22b-distilled-transformer-comfy-int8-convrot | 蒸馏版DiT模型(Comfy int8 + convrot),仅支持ComfyUI环境,不适用于ltx-pipelines / PyTorch |
| ltx-2.5-22b-dev-transformer-comfy-int8-convrot | 完整版DiT模型(Comfy int8 + convrot),仅支持ComfyUI环境,不适用于ltx-pipelines / PyTorch |
| ltx-2.5-22b-distilled-transformer-nvfp4 | 蒸馏版DiT模型(NVFP4),支持ComfyUI环境,也可在ltx-pipelines中配合--quantization nvfp4-prequant参数使用(需Blackwell / ltx-kernels支持) |
模型下载与本地部署
LTX-2.5包含22B Transformer、Gemma 4 12B文本编码器、视频与音频VAE多个组件,需要分别加载。需要注意的是,该模型不支持MoE式“激活参数”,实际的资源占用情况取决于选用的权重精度、解码器、分辨率、生成帧数以及是否启用量化和内存卸载策略。
模型下载
pip install -U modelscope
modelscope download \
--model Lightricks/LTX-2.5 \
--local_dir ./LTX-2.5
官方推理环境搭建
首先克隆官方代码仓库并配置依赖环境:
git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2
uv sync --extra natten
source .venv/bin/activate
建议使用Python >= 3.12、CUDA >= 12.7、PyTorch ~= 2.7版本运行项目。
蒸馏版文本到视频生成
使用如下命令运行文本驱动的视频生成任务:
uv run python -m ltx_pipelines.distilled \
--transformer-path ../LTX-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
--text-encoder-path ../LTX-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
--video-vae-path ../LTX-2.5/vae/ltx-2.5-video-vae-bf16.safetensors \
--audio-vae-path ../LTX-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors \
--spatial-upsampler-path ../LTX-2.5/latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
--duration-head-path ../LTX-2.5/model_patches/ltx-2.5-duration-head-bf16.safetensors \
--prompt "A golden retriever running through a sunny meadow, cinematic lighting" \
--seed 42 \
--output-path output_distilled.mp4
如果省略--num-frames参数,模型会自动调用Duration Predictor确定视频时长;若手动指定帧数,需满足num_frames % 8 == 1的要求,同时视频宽高需能被32整除。
图像到视频生成
如果需要基于图像生成视频,可以添加--image参数指定输入图像路径、帧索引与强度值(帧0表示首帧条件):
uv run python -m ltx_pipelines.distilled \
--transformer-path models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
--text-encoder-path models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
--video-vae-path models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors \
--audio-vae-path models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors \
--duration-head-path models/ltx-2.5/model_patches/ltx-2.5-duration-head-bf16.safetensors \
--spatial-upsampler-path models/ltx-2.3/ltx-2.3-spatial-upscaler-x2-1.1.safetensors \
--image path/to/first_frame.jpg 0 1.0 \
--prompt "The camera slowly dollies out as wind moves through the grass" \
--seed 42 \
--output-path output_i2v.mp4
官方还提供了ComfyUI工作流与相关权重,完整的集成说明可查看官方文档。

