文章摘要
近期,220亿参数的音画生成模型LTX - 2.5正式开源。它是LTX - 2系列的最新版本,升级了视频解码等流程,新增多镜头生成等能力。核心功能有画面优化、多镜头连贯等。技术上采用新解码器等优化。提供多种权重版本,文中给出了模型下载、部署及不同方式生成视频的操作命令和相关注意事项。

近期,一款参数规模达220亿的音画生成模型正式对外开源,该模型可根据文本、图像或视频输入生成同步匹配的音视频内容。作为LTX-2系列的最新迭代版本,其在原有基础上升级了视频解码、提示词理解与蒸馏流程,新增了原生多镜头生成、自动时长预测、4K HDR与RAW工作流等多项能力,同时提供面向微调开发的完整权重与固定步数推理的轻量化版本。

相关模型与部署资源可通过以下平台获取:

核心功能升级

新版本替换了此前使用的VAE重建阶段,采用全新的Diffusion Video Decoder来将视频潜变量还原为最终输出画面,重点优化了人脸细节、纹理清晰度、画面文字呈现以及运动画面的稳定性。官方展示的越野摩托涉水案例中,该解码器有效处理了高速运动的主体、飞溅的泥点、积水反光以及跟随镜头带来的画面变化,大幅减少了动态场景中的视觉瑕疵。

LTX-2.5支持在单次生成任务中组织多个衔接连贯的镜头,在切换镜头后仍能保持人物、环境、光照、声音以及整体视觉风格的一致性。官方以极光下的探索者场景为例,展示了同一段视频内不同景别切换与镜头过渡的自然效果。

模型搭载了定制的Gemma 4 12B文本编码器,并加入了Prompt Enhancer模块,可以处理包含多人物、动作指令、镜头运动要求、光照设定等复杂的描述内容,有效减少长提示词中的指令遗漏问题,提升复杂场景的生成准确率。

新版本新增了可选的Duration Predictor模块,当用户未手动指定生成帧数时,模型可以根据提示词中的动作描述自动判断所需的视频时长,再匹配对应的生成帧数,让镜头长度与动作节奏更加适配。

官方还推出了面向专业后期制作的原生4K HDR与RAW/EXR工作流,支持调色、合成等专业后期环节。需要注意的是,本地生成可达到的分辨率、生成速度与显存占用情况,会根据选用的权重格式、解码器、上采样流程以及硬件配置有所不同。

技术实现细节

新版本的多项升级背后,依托了多项核心技术优化:

全新扩散视频解码器

通过Diffusion Video Decoder替代传统VAE重建流程,不仅提升了画面细节与运动稳定性,权重包中还提供了速度优先的卷积VAE选项,用户可以根据画质、生成速度与显存占用的需求灵活选择解码方式。

提示词增强与自动时长预测

定制的Gemma 4 12B文本编码器搭配Prompt Enhancer模块,可以将复杂的用户提示词转换为模型可识别的条件信息。新增的Duration Head模块则可以根据提示词中的动作描述预测所需的生成帧数:当未指定num_frames参数时,自动确定视频片段长度;若用户手动指定帧数,则按照设置生成内容。需要注意的是,手动指定的帧数需要满足num_frames % 8 == 1的要求,同时视频的宽度和高度需能被32整除。

Diffusion Fidelity Rendering渲染策略

LTX-2.5引入了Diffusion Fidelity Rendering技术,可以根据场景的复杂程度动态分配渲染计算资源,在控制整体计算开销的同时,保证逐帧的像素输出质量。

开源权重版本说明

本次开源的模型提供了多种不同规格的权重版本,以适配不同的使用场景:

权重名称 功能说明
ltx-2.5-22b-dev-transformer-bf16 完整模型,适用于高质量生成流程与模型微调
ltx-2.5-22b-distilled-transformer-bf16 固定8步推理的蒸馏版模型,CFG=1
ltx-2.5-22b-distilled-transformer-comfy-int8-convrot 蒸馏版DiT模型(Comfy int8 + convrot),仅支持ComfyUI环境,不适用于ltx-pipelines / PyTorch
ltx-2.5-22b-dev-transformer-comfy-int8-convrot 完整版DiT模型(Comfy int8 + convrot),仅支持ComfyUI环境,不适用于ltx-pipelines / PyTorch
ltx-2.5-22b-distilled-transformer-nvfp4 蒸馏版DiT模型(NVFP4),支持ComfyUI环境,也可在ltx-pipelines中配合--quantization nvfp4-prequant参数使用(需Blackwell / ltx-kernels支持)

模型下载与本地部署

LTX-2.5包含22B Transformer、Gemma 4 12B文本编码器、视频与音频VAE多个组件,需要分别加载。需要注意的是,该模型不支持MoE式“激活参数”,实际的资源占用情况取决于选用的权重精度、解码器、分辨率、生成帧数以及是否启用量化和内存卸载策略。

模型下载

pip install -U modelscope
modelscope download \
--model Lightricks/LTX-2.5 \
--local_dir ./LTX-2.5

官方推理环境搭建

首先克隆官方代码仓库并配置依赖环境:

git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2
uv sync --extra natten
source .venv/bin/activate

建议使用Python >= 3.12、CUDA >= 12.7、PyTorch ~= 2.7版本运行项目。

蒸馏版文本到视频生成

使用如下命令运行文本驱动的视频生成任务:

uv run python -m ltx_pipelines.distilled \
--transformer-path ../LTX-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
--text-encoder-path ../LTX-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
--video-vae-path ../LTX-2.5/vae/ltx-2.5-video-vae-bf16.safetensors \
--audio-vae-path ../LTX-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors \
--spatial-upsampler-path ../LTX-2.5/latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
--duration-head-path ../LTX-2.5/model_patches/ltx-2.5-duration-head-bf16.safetensors \
--prompt "A golden retriever running through a sunny meadow, cinematic lighting" \
--seed 42 \
--output-path output_distilled.mp4

如果省略--num-frames参数,模型会自动调用Duration Predictor确定视频时长;若手动指定帧数,需满足num_frames % 8 == 1的要求,同时视频宽高需能被32整除。

图像到视频生成

如果需要基于图像生成视频,可以添加--image参数指定输入图像路径、帧索引与强度值(帧0表示首帧条件):

uv run python -m ltx_pipelines.distilled \
--transformer-path     models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
--text-encoder-path     models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
--video-vae-path       models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors \
--audio-vae-path       models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors \
--duration-head-path   models/ltx-2.5/model_patches/ltx-2.5-duration-head-bf16.safetensors \
--spatial-upsampler-path models/ltx-2.3/ltx-2.3-spatial-upscaler-x2-1.1.safetensors \
--image path/to/first_frame.jpg 0 1.0 \
--prompt "The camera slowly dollies out as wind moves through the grass" \
--seed 42 \
--output-path output_i2v.mp4

官方还提供了ComfyUI工作流与相关权重,完整的集成说明可查看官方文档。

以上内容不代表本平台立场,仅供读者参考