SadTalker 本地部署指南:一张照片加一段音频生成数字人视频
【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker
SadTalker 是一个 CVPR 2023 的音频驱动人脸动画项目:给它一张人像图片和一段音频,就能输出口型、表情与头部动作同步的说话视频,全程可在本地离线运行,无需联网推理。
先看效果:它能做什么
上图为 4D 自由视角模式(--input_yaw等参数)生成的同一数字人三个视角,面部细节保持一致,头姿可由参数任意指定。项目还支持全身图动画、参考视频眨眼、GFPGAN 人脸增强,以及 Stable Diffusion WebUI 插件形式集成。
动手前先选方案
| 运行方式 | 资源成本 | 上手门槛 | 适合场景 |
|---|---|---|---|
本地一键启动(webui.sh/webui.bat) | 一张独显更佳,4GB 显存可跑,约 10GB 磁盘 | 低,脚本自动建 venv 并装依赖 | 长期自用、对数据敏感的场景 |
| Docker 容器 | 需 GPU 与 Docker 环境 | 中,命令固定、环境隔离 | 服务器部署、多项目共存 |
| 在线 Notebook | 免费额度、依赖网络 | 最低,打开即用 | 体验效果、临时测试 |
把环境跑起来
拿到代码
git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker模型文件放哪里
bash scripts/download_models.sh该脚本会自动把渲染与映射权重下载到checkpoints/、人脸增强权重下载到gfpgan/weights/。网络受限时可手动下载模型压缩包,按同样目录结构解压即可;项目还自带gfpgan/离线补丁,生成过程中不会临时联网拉模型。
启动界面
bash webui.sh # Windows 改为双击 webui.bat启动脚本会自动创建venv虚拟环境、安装依赖并打开 Gradio 网页界面。macOS / M1 上如报 dlib 错误,按 docs/install.md 额外执行一次pip install dlib即可。
产出第一个结果
界面上传两张素材即可生成,命令行方式等价于python inference.py。
- 图像:选正面、光线均匀、无遮挡的人像;全身照请改用
--preprocess full并搭配--still,让动作只发生在脸部,效果更稳。示例图可参考 examples/source_image/,如。
- 音频:支持 wav / mp3,清晰无底噪的素材口型更准,仓库示例音轨在 examples/driven_audio/。
两个关键参数:--expression_scale控制表情幅度,默认 1.0,表情平淡可调到 1.2~1.5;--enhancer gfpgan对生成人脸做修复增强,分辨率不足时建议开启。完整参数表见 最佳实践文档。
踩坑对照:常见问题速解
- 报
ffmpeg not found→ 系统未装 ffmpeg 或不在 PATH → Linux/macOS 用conda install ffmpeg或brew install ffmpeg,Windows 装好后把 ffmpeg 加入 PATH,详见 FAQ。 - 报模型文件缺失或 unexpected EOF→ 权重未下载完整或放错目录 → 核对
checkpoints/与gfpgan/weights/的文件清单,删掉坏文件重新下载。 - CUDA out of memory→ 显存不足 → 设置
PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:128环境变量后重试,或降分辨率、关增强。 - 解码音频报 invalid data→ 输入格式不支持 → 只支持 wav 或 mp3,先用 ffmpeg 转码。
进阶方向
- 批量生成:
src/generate_batch.py一次性处理多张图片; - 参数调优:
docs/best_practice.md覆盖 crop / resize / full 三种预处理与增强开关; - 集成 Stable Diffusion WebUI:
scripts/extension.py与 docs/webui_extension.md; - 3D 人脸与自由视角:docs/face3d.md。
更多细节与已知问题可查阅项目 README 与 docs/FAQ.md。
【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考