小显存跑通 MiniMax-H3 Turbo LoRA:3 组关键设置的完整指南
【免费下载链接】MiniMax-H3-Turbo-Lora项目地址: https://ai.gitcode.com/hf_mirrors/larryvrh/MiniMax-H3-Turbo-Lora
MiniMax-H3 Turbo LoRA 把视频+立体声渲染压到 4 步快速采样,约快 5 倍,但 33B 底座让显存常常不够。读完这篇,小显存也能跑出 1344×768、5 秒的音视频。
🧮 显存需求速查:10 秒定位你的档位
| 配置项 | 推荐值 | 对显存的影响 |
|---|---|---|
| 检查点 | minimax_h3_turbo_v4_step600_ema.safetensors(约 744 MB) | LoRA 本身几乎不占显存,压力全在底座上 |
| 底座模型 | 量化版(int8 / fp8)或 bf16,走 ComfyUI 流式加载 | bf16 全精度大约要 80 GB 才从容;量化 + 流式可以下探到小卡 |
| 分辨率 × 帧数 | 1344×768、124 帧(约 5 秒) | 随像素和帧数同步上涨,是最先该砍的两项 |
| 独立脚本模式 | 追加 --offload-adaln | 约省 13 GB VRAM,代价是改吃 CPU 内存 |
先对号入座:走 ComfyUI 就盯住第二行,跑 generate.py 就盯住第四行,其余项两个模式通用。
把采样步骤压在 4–8、强度锁在 1.0
- 采样步骤:推荐 4–8,其中 4 是最小值。6–8 步观感明显更好,显存允许就加到 6–8;超过 8 步不再有收益,反而开始引入过度锐化伪影。
- 强度:保持 1.0,它对 4–8 步区间都做过调优。只有单条片子翻车时再动它:出现拖影、重影就微升到 1.05–1.2;出现过锐颗粒就降到 0.8–0.95。
- 分辨率:宽高取 32 的倍数,短边通常 768(如 1344×768)。任何一边拉高,显存占用同步上涨;OOM 时先砍这里。
- 帧数:24 fps 下按 17·k+5 网格对齐,验证过的区间约 124–362 帧(5–15 秒)。时长翻倍显存跟着翻倍,没有额外收益。
- 调度器:固定在 simple,不用碰。
在 ComfyUI 关掉 low_vram、给 generate.py 加 --offload-adaln
图形界面(ComfyUI):默认全关,OOM 才开
- low_vram 开关:默认关——运行时挂载 LoRA,画面最锐利;只有显存爆了才开,开启后 LoRA 合并进权重,拿到最低峰值显存,量化底座上会稍软。
- 节点自动检测:Turbo 节点能识别修剪过的底座(pruned_int8 / pruned_fp8),并在运行时重新注入时间条件,所以一个 LoRA 文件覆盖所有底座,不用为换底座多占一份显存。
- 接线只需两处改动:把 Turbo LoRA 插在模型加载器与采样器之间,用 Turbo Sampler 给 SamplerCustomAdvanced 喂流,调度器保持 simple、步数 ≥ 4。仓库自带的 minimax_h3_t2v_turbo.json 工作流可以直接拖进画布。
独立脚本(generate.py):只加一个关键 flag
- --offload-adaln:把只随时间步变化的 adaLN 投影权重留在 CPU fp32,约省 13 GB VRAM;4 步时这次矩阵乘法很便宜,几乎无感。
- --steps:默认 4,按上文压到 4–8。
- 其余参数一句话带过:--base / --lora / --te / --video-vae / --audio-vae 分别指向底座、LoRA、文本编码器和两个 VAE;--width / --height / --frames 按速查表填。另外 generate.py 需要本地有一份 ComfyUI 检出(commit 14b05228)来提供 H3 模型定义,--comfyui 指向它即可。最小可运行示例:
python generate.py \ --comfyui ./ComfyUI \ --base models/diffusion_models/minimax_h3_fl2va_bf16.safetensors \ --lora minimax_h3_turbo_v4_step600_ema.safetensors \ --te models/text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors \ --video-vae models/vae/minimax_h3_video_vae_fp16.safetensors \ --audio-vae models/vae/minimax_h3_audio_vae_fp32.safetensors \ --prompt "A corgi chef flipping a pancake" \ --width 1344 --height 768 --frames 124 --steps 6 --out corgi.mp4 --offload-adaln🔧 排查高频问题:拖影、过锐、OOM 一句话处理
- 拖影 / 运动涂抹:4 步 + 大幅快速运动时的已知短板,是 v4 静态帧增强的代价 → 步数加到 6–8 基本消除;坚持 4 步就换 v1 的 minimax_h3_turbo_4step_ema_ckpt850.safetensors。
- 过度锐化 / 塑料感:多见于旧 v1 约 850 检查点,或步数 > 8 → 换回 minimax_h3_turbo_v4_step600_ema.safetensors,步数压回 8 以内。
- 显存溢出(OOM):底座 33B 本来就大,分辨率帧数又叠高了 → ComfyUI 里开 low_vram 并上量化底座;独立脚本加 --offload-adaln,再降分辨率或帧数。
- 画面偏软:开了 low_vram,LoRA 合并进量化权重 → 显存还有余量就把开关关掉,回到运行时挂载。
调参顺序记一句:先定检查点和步数(v4 step600 EMA + 6–8 步),再压分辨率和帧数,最后才动 low_vram 与 --offload-adaln 这类显存开关。强度和调度器默认不动,只有单条片子翻车时才微调强度。
【免费下载链接】MiniMax-H3-Turbo-Lora项目地址: https://ai.gitcode.com/hf_mirrors/larryvrh/MiniMax-H3-Turbo-Lora
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考