LTX-Video 视频生成部署完全指南:8GB 显存起步,H100 上 10 秒出一条 4 秒片
【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video
LTX-Video 是开源的 DiT 架构实时视频生成模型,一套权重覆盖文生视频、图生视频、多条件控制与视频延长。2B 蒸馏版约 10 个采样步出一条 1216×704@30FPS、4 秒的视频,8GB 显存的卡就能起步,H100 上单条 10 秒出片。
🔍 先选型:4 个主力配置怎么选
选型决定了后面每一步的硬件成本和出片质量。先看对比表,再看三句结论。
| 模型 | 配置文件 | 显存档位 | 官方定位 |
|---|---|---|---|
| ltxv-2b-0.9.8-distilled | ltxv-2b-0.9.8-distilled.yaml | 最低(8GB 级) | 轻量快速,免 CFG/STG,少步数采样 |
| ltxv-2b-0.9.8-distilled-fp8 | ltxv-2b-0.9.8-distilled-fp8.yaml | 更低(需 Ada 系及以上显卡) | 2B 蒸馏 + FP8 量化省显存 |
| ltxv-13b-0.9.8-distilled | ltxv-13b-0.9.8-distilled.yaml | 中(建议 16GB 级) | 速度质量平衡点,官方推荐迭代配置 |
| ltxv-13b-0.9.8-dev | ltxv-13b-0.9.8-dev.yaml | 高(官方标注"需要更多显存") | 最高质量,30 步 + CFG/STG 全流程 |
| ltxv-13b-0.9.8-dev-fp8 | ltxv-13b-0.9.8-dev-fp8.yaml | 中高 | 13B 全量质量 + 量化省显存 |
结论:8GB 卡选 2B 蒸馏版起步,先 720×480 再上 704×1216;16GB 级卡选 13B 蒸馏版,是迭代性价比最高的档位;追求成片质量用 13B dev,显存吃紧就换 dev-fp8。多条件控制(深度/姿态/线条)需搭配官方 IC-LoRA,走 configs/ 里对应的 13B 配置。
两条命令预检:8GB 显卡能不能跑
代码库官方测试环境是 Python 3.10.5、CUDA 12.2、PyTorch ≥ 2.1.2(pyproject.toml 要求 Python ≥ 3.10)。跑两条预检:
nvidia-smi python -c "import torch; print(torch.cuda.is_available(), torch.version.cuda)"第一条看驱动与显存,第二条应输出True和 CUDA 版本号。8GB 卡建议直接锁定 2B 蒸馏配置;24GB 级卡可以按 13B 蒸馏版规划。
四行命令装环境,一条命令出第一条视频
git clone https://gitcode.com/GitHub_Trending/ltx/LTX-Video cd LTX-Video python -m venv env && source env/bin/activate pip install -e .[inference]首跑用仓库自带测试图走图生视频:
python inference.py \ --prompt "海浪拍打岩石的慢动作视频,金色光线,细节丰富" \ --conditioning_media_paths tests/utils/woman.jpeg \ --conditioning_start_frames 0 \ --height 704 --width 1216 \ --num_frames 121 --frame_rate 30 --seed 42 \ --pipeline_config configs/ltxv-2b-0.9.8-distilled.yaml关键参数说明:
--conditioning_media_paths传首帧图或视频段,--conditioning_start_frames 0表示从第 0 帧开始生成;--num_frames 121满足 8n+1 规则(8×15+1),30FPS 下约 4 秒;704×1216是官方默认分辨率(需为 32 的倍数),8GB 卡可先改--height 480 --width 720;- prompt 少于 120 词会自动触发增强模型,首次运行多下两个小模型。
验收:看 outputs 目录和四条参考耗时
跑通的判断标准只有一个:日志出现Output saved to ...,且outputs/日期/目录下多出video_output_*.mp4。首次运行会自动下载权重(ltx_video/inference.py 里走 hf_hub_download),13B 权重明显大于 2B,下载耗时取决于网络。
| 测试卡 | 模型与规格 | 输出标准 | 参考耗时 |
|---|---|---|---|
| H100 | 13B 蒸馏版 | HD 单条视频 | 约 10 秒,3 秒可见低清预览(官方 v0.9.7 公告) |
| H100 | 2B 蒸馏版 | 1216×704@30FPS | 实时级(官方标注 "real time on H100") |
| RTX 4060(8GB) | 2B + 社区 Q8 8 位 | 720×480×121 | 1 分钟以内(README 社区板块) |
| 8GB 级消费卡 | 2B 蒸馏 bf16 | 704×1216×121 | 官方未给统一基线,建议实测 |
注意:官方 README 只给相对描述("less VRAM usage"),具体 GB 数以上表来源为准,不要拿别人的博客数字当基准。
⚡ 调优:三档改法,先零改动再动参数
每档都按"改什么 → 收益 → 代价"给。
第一档:零改动,只换配置文件
- 把
--pipeline_config从 dev 换成 distilled:官方数据 2B 蒸馏版比非蒸馏版快 15 倍,免 CFG/STG;代价是官方定位"轻微质量下降"。 - 再换 fp8 配置:显存进一步下降、加载更快;代价是需要 Ada 系及以上显卡装 Q8 kernels,老卡直接不可用。
第二档:改一个参数
num_inference_steps从 40+ 降到 20~30:dev 版官方口径"20-30 步换速度",单条耗时约降三成以上;代价是细节略损。蒸馏版建议 8 步(官方推荐值)。guidance_scale设 3~3.5:官方推荐区间,提示词遵循最稳;超出 5 会过拟合提示词导致画面失真。decode_noise_scale保持配置默认 0.025:影响 VAE 解码色彩保真,调到 0.01~0.03 之间微调;代价是偏离过大色彩会偏。
第三档:动管线
- 启用
--offload_to_cpu:把不用的模块卸载到 CPU 省显存,代价是生成变慢,且代码里仅在 GPU 显存低于 30GB 时才真正生效,别当常规手段。 - 降分辨率到 720×480:显存和耗时同步下降,8GB 卡有社区验证数据;代价是细节明显损失,留给最后。
stg_mode在attention_values/attention_skip/residual/transformer_block四档间切:影响 STG 的层跳过策略(见 skip_layer_strategy.py),速度和质量联动变化,逐档试。
接入业务:图生视频、视频延长和 API 套壳
场景一:图生视频。静图 + prompt 直接出片,核心是--conditioning_media_paths传图、--conditioning_start_frames 0定首帧。image_cond_noise_scale(默认 0.15)控制对原图的偏离度,人物图建议 0.1~0.3,风格化场景可以调高。
场景二:视频延长。同一条命令把路径换成视频段即可,但输入段帧数必须是 8n+1(9、17、25……),目标--num_frames要是 8 的倍数,否则被自动补齐裁剪。条件放在第 0 帧就是向前续写,放在靠后帧号就是向后回补;多段条件用--conditioning_strengths(0~1)分别控强度。
场景三:API 服务化。ltx_video/inference.py 暴露了infer和InferenceConfig,调用写法可直接参考 tests/test_inference.py。用 FastAPI 收 prompt、图片路径和参数,进程内持有 pipeline,uvicorn起多 worker;一张 24GB 卡约支撑单路 13B 蒸馏并发,多卡按进程分片。
| 方案 | 月成本(约) | 日处理量 |
|---|---|---|
| 1× 4060 级(8GB)云竞价 | ¥400~600 | 300~500 条 720p/4 秒级 |
| 2× 4090(24GB) | ¥3000~5000 | 2000~4000 条 1080p 级(13B 蒸馏) |
| 8× A100(80GB) | ¥25000~40000 | 20000~40000 条 |
成本为估算值,实际随云厂商竞价价格和片段长短浮动,非实时负载尽量走竞价实例。
排障:6 个现象的处理顺序
| 现象 | 第一反应 | 根治办法 |
|---|---|---|
| CUDA out of memory | 减--num_frames到 121 或降 720×448,显存立降 | 换蒸馏/fp8 配置(官方定位省显存),或开--offload_to_cpu(省显存、费时间) |
| 模型文件缺失/下载中断 | 重跑命令,代码自动经 hf_hub_download 续传 | 核对 yaml 里checkpoint_path与spatial_upscaler_model_path,手动补齐放 SSD |
| 日志出现 "Padded dimensions" 警告 | 不用处理,自动补齐后裁剪,输出仍是设定尺寸 | 直接选 32 倍数分辨率 + 8n+1 帧(121/257),省掉无效计算 |
| 帧间抖动、跳变 | 确认配置stg_mode: attention_values(默认值) | dev 版保持 30 步 + STG 全开;蒸馏版开stochastic_sampling: true |
| 文本与画面不匹配 | prompt 改写成时序化单段、200 词内(官方 prompt 指南) | 短 prompt 会自动调增强模型(阈值 120 词);检查 yaml 中text_encoder_model_name_or_path |
| fp8 配置报 Q8-Kernels 未找到 | 换 bf16 配置先出片 | 安装 Q8 kernels 依赖,仅 Ada 系及以上显卡支持 |
三句话收个尾
选型看卡:8GB 上 2B 蒸馏、16GB 上 13B 蒸馏、24GB 上 13B dev,一张对比表定终身。跑通靠三件事:两条命令预检、四行安装、一条首跑命令,验收只看 outputs 目录出不出 mp4。提速靠降档:换配置、减步数、降分辨率,每档都有官方数字可查。LTX-2 已把音频同步生成和多关键帧控制提上日程,这套部署栈的用法基本可以平移。踩坑和用法分享建议直接去项目 issue 区提交,维护者会看。
附录:参数速查表
| 参数 | 推荐范围 | 踩坑提示 |
|---|---|---|
| height / width | 32 的倍数,704×1216 起 | 超过 720×1280 效果下降,显存翻倍 |
| num_frames | 8n+1,常用 121 / 257 | 帧数上限建议 257 以内(官方口径) |
| seed | 任意整数,默认 171198 | 存下好结果的 seed 才能复现 |
| guidance_scale | 3~3.5(dev 版) | 蒸馏版此值固定为 1,别手改 |
| num_inference_steps | dev:40+ 质量 / 20~30 速度;蒸馏:8 | 步数低于 8 细节快速劣化 |
| image_cond_noise_scale | 0.1~0.3,默认 0.15 | 调低更贴原图,调高更自由 |
| conditioning_strengths | 0~1,默认 1.0 | 多条件时数组长度必须对齐 |
| decode_noise_scale | 0.01~0.03,默认 0.025 | 影响解码色彩保真 |
| offload_to_cpu | 显存不足时 True | 显存 ≥30GB 的卡不会触发卸载 |
| precision | bfloat16 / float8_e4m3fn | fp8 必须 Ada 系显卡 + Q8 kernels |
关键词:LTX-Video 实时视频生成部署、LTX-Video 低显存推理、LTX-Video 图生视频教程、LTX-Video 蒸馏模型加速、LTX-Video 本地视频生成配置
【免费下载链接】LTX-VideoOfficial repository for LTX-Video项目地址: https://gitcode.com/GitHub_Trending/ltx/LTX-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考