generative-models:用 SV3D 把一张图片变成 3D 环绕视频的实战指南
【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models
generative-models 是 Stability AI 官方的开源生成模型代码库,其中最受关注的是 SV3D 图像转视频系列:一张静态图片可以生成 21 帧、576x576 的 360 度环绕视频,适合做商品多角度展示和视觉素材生产。仓库同时包含 SVD 图生视频、SDXL 文生图,以及把短视频扩展成多视角 4D 序列的 SV4D 模型。本文给出安装、选型、调参的完整路径,目标是让你在自己的 GPU 上跑通第一个可用结果。
能力地图:单图转环绕视频、视频转 4D、文生图各对应哪个模型
仓库里的推理脚本按模型版本分文件组织,选型先看这张表:
| 模型 | 输入 | 输出 | 典型用途 |
|---|---|---|---|
| SV3D_u | 单张图片 | 21 帧环绕视频,576x576 | 物体 360 度环绕展示 |
| SV3D_p | 单张图片 + 相机路径 | 21 帧自定义视角视频 | 精确控制仰角/方位角 |
| SVD / SVD-XT | 单张图片 | 14 / 25 帧视频,576x1024 | 通用图生视频 |
| SV4D / SV4D 2.0 | 5 / 12 帧短视频 | 多视角 4D 视频 | 动态物体的 4D 资产 |
需要注意的边界:SV3D 的训练分布是"白底、单物体、居中"的图片,输出固定 21 帧,不适合复杂实景或多主体长视频;这类输入建议先做前景分割。
最小可行路径:装好环境后 10 分钟出第一个环绕视频
克隆仓库并安装依赖(推荐 Python 3.10,CUDA 版本按 README 中的 cu118 索引):
git clone https://gitcode.com/GitHub_Trending/ge/generative-models cd generative-models python3.10 -m venv .generativemodels source .generativemodels/bin/activate pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 pip3 install -r requirements/pt2.txt pip3 install .下载 SV3D_u 权重到checkpoints/,然后用仓库自带示例图跑第一条推理:
huggingface-cli download stabilityai/sv3d sv3d_u.safetensors --local-dir checkpoints python scripts/sampling/simple_video_sample.py \ --input_path assets/test_image.png \ --version sv3d_u \ --num_steps 50 \ --seed 23生成结果(mp4)会写入outputs/simple_video_sample/sv3d_u/。脚本对非透明图片会自动做 rembg 抠图、居中裁切并缩放到 576x576,输入不需要额外预处理;如果你已有透明背景的 RGBA 图,脚本会跳过抠图直接使用。
怎么选 sv3d_u 和 sv3d_p
- 只要绕着物体转一圈:选 sv3d_u,不带任何相机参数。
- 需要固定视角高度、或按序列控制仰角/方位角:选 sv3d_p。
sv3d_p 的两个关键参数:
--elevations_deg:单个角度(会广播到 21 帧)或 21 个值组成的列表,取值范围 -90 到 90。--azimuths_deg:21 个方位角组成的列表,范围 0 到 360,必须升序;不提供时默认在 0-360 均匀分布。
只生成固定仰角的静态环绕时,一条命令即可:
python scripts/sampling/simple_video_sample.py \ --input_path assets/test_image.png \ --version sv3d_p \ --elevations_deg 10.0参数怎么调,常见问题怎么避坑
| 参数 | 建议值 | 说明 |
|---|---|---|
| num_steps | 预览 25-30,正式 50(默认) | 步数越多越稳,耗时线性增加 |
| seed | 默认 23 | 固定种子可复现结果 |
| decoding_t | 显存不足时调低 | 逐段解码,默认 14 帧一次,是最吃显存的环节 |
| 输入图片 | 单物体、居中、白底 | 与训练分布一致,效果最稳 |
常见问题的处理顺序:
- 画面闪烁、抖动:先把 num_steps 提到 50;实景输入先分割前景再跑。
- 物体变形:确认主体居中、占比合适;背景复杂时可先处理成透明背景 RGBA 图,跳过自动抠图。
- 显存溢出:SV3D 用
--decoding_t 1;SV4D/SV4D 2.0 脚本可再加--encoding_t 1 --img_size 512。 - 产出合规:输出内嵌隐形水印,可用
scripts/demo/detect.py检测。
延伸:输入是视频时用 SV4D 2.0 生成 4D 资产
如果你的素材是动态物体的短视频而不是静图,直接上 SV4D 2.0:它每次生成 12 帧 x 4 个相机视角,脚本默认自回归扩展到 21 帧。输入支持 gif/mp4 单文件、帧图片文件夹或文件名匹配模式。
huggingface-cli download stabilityai/sv4d2.0 sv4d2.safetensors --local-dir checkpoints python scripts/sampling/simple_video_sample_4d2.py \ --input_path assets/sv4d_videos/camel.gif \ --output_folder outputs延伸阅读:配置与源码入口
- 采样脚本:simple_video_sample.py、simple_video_sample_4d2.py,参数名以脚本签名为准。
- 各版本模型配置集中在 scripts/sampling/configs/,改默认帧数、步数从这里入手。
- 训练框架采用配置驱动方式,示例见 configs/example_training/,如
python main.py --base configs/example_training/toy/mnist_cond.yaml。
下一步建议:先用 sv3d_u 跑通示例图,再换自己的产品图对比效果;确定视角需求后切到 sv3d_p 调相机路径。
【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考