news 2026/9/12 18:17:49

SadTalker 本地部署指南:一张照片加一段音频生成数字人视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
SadTalker 本地部署指南:一张照片加一段音频生成数字人视频

SadTalker 本地部署指南:一张照片加一段音频生成数字人视频

【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker

SadTalker 是一个 CVPR 2023 的音频驱动人脸动画项目:给它一张人像图片和一段音频,就能输出口型、表情与头部动作同步的说话视频,全程可在本地离线运行,无需联网推理。

先看效果:它能做什么

上图为 4D 自由视角模式(--input_yaw等参数)生成的同一数字人三个视角,面部细节保持一致,头姿可由参数任意指定。项目还支持全身图动画、参考视频眨眼、GFPGAN 人脸增强,以及 Stable Diffusion WebUI 插件形式集成。

动手前先选方案

运行方式资源成本上手门槛适合场景
本地一键启动(webui.sh/webui.bat一张独显更佳,4GB 显存可跑,约 10GB 磁盘低,脚本自动建 venv 并装依赖长期自用、对数据敏感的场景
Docker 容器需 GPU 与 Docker 环境中,命令固定、环境隔离服务器部署、多项目共存
在线 Notebook免费额度、依赖网络最低,打开即用体验效果、临时测试

把环境跑起来

拿到代码

git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker

模型文件放哪里

bash scripts/download_models.sh

该脚本会自动把渲染与映射权重下载到checkpoints/、人脸增强权重下载到gfpgan/weights/。网络受限时可手动下载模型压缩包,按同样目录结构解压即可;项目还自带gfpgan/离线补丁,生成过程中不会临时联网拉模型。

启动界面

bash webui.sh # Windows 改为双击 webui.bat

启动脚本会自动创建venv虚拟环境、安装依赖并打开 Gradio 网页界面。macOS / M1 上如报 dlib 错误,按 docs/install.md 额外执行一次pip install dlib即可。

产出第一个结果

界面上传两张素材即可生成,命令行方式等价于python inference.py

  • 图像:选正面、光线均匀、无遮挡的人像;全身照请改用--preprocess full并搭配--still,让动作只发生在脸部,效果更稳。示例图可参考 examples/source_image/,如
  • 音频:支持 wav / mp3,清晰无底噪的素材口型更准,仓库示例音轨在 examples/driven_audio/。

两个关键参数:--expression_scale控制表情幅度,默认 1.0,表情平淡可调到 1.2~1.5;--enhancer gfpgan对生成人脸做修复增强,分辨率不足时建议开启。完整参数表见 最佳实践文档。

踩坑对照:常见问题速解

  • ffmpeg not found→ 系统未装 ffmpeg 或不在 PATH → Linux/macOS 用conda install ffmpegbrew install ffmpeg,Windows 装好后把 ffmpeg 加入 PATH,详见 FAQ。
  • 报模型文件缺失或 unexpected EOF→ 权重未下载完整或放错目录 → 核对checkpoints/gfpgan/weights/的文件清单,删掉坏文件重新下载。
  • CUDA out of memory→ 显存不足 → 设置PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:128环境变量后重试,或降分辨率、关增强。
  • 解码音频报 invalid data→ 输入格式不支持 → 只支持 wav 或 mp3,先用 ffmpeg 转码。

进阶方向

  • 批量生成:src/generate_batch.py一次性处理多张图片;
  • 参数调优:docs/best_practice.md覆盖 crop / resize / full 三种预处理与增强开关;
  • 集成 Stable Diffusion WebUI:scripts/extension.py与 docs/webui_extension.md;
  • 3D 人脸与自由视角:docs/face3d.md。

更多细节与已知问题可查阅项目 README 与 docs/FAQ.md。

【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 18:14:42

轻量级YOLO11n实战指南:边缘设备实时目标检测全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 18:11:21

Android端LLM模型集成与优化实战指南

1. Android应用集成LLM的核心挑战在移动端部署大语言模型(LLM)需要解决三个核心矛盾:模型体积与设备存储的冲突、计算需求与硬件性能的差距、实时响应与能耗控制的平衡。以7B参数的Llama 2模型为例,仅权重文件就需13GB存储空间&am…

作者头像 李华
网站建设 2026/9/12 18:09:46

基于SpringBoot的纯净水配送管理系统(源代码+文档+PPT+调试+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

作者头像 李华
网站建设 2026/9/12 18:09:39

Roo Code 自然语言请求指南:如何高效地向 AI 编程助手描述需求

Roo Code 自然语言请求指南:如何高效地向 AI 编程助手描述需求 【免费下载链接】Roo-Code Roo Code gives you a whole dev team of AI agents in your code editor. 项目地址: https://gitcode.com/GitHub_Trending/ro/Roo-Code Roo Code 是一套运行在你代码…

作者头像 李华
网站建设 2026/9/12 18:08:56

OpenClaw多轮问答的答案验证机制与技术实现

1. OpenClaw多轮问答中的答案验证机制解析 OpenClaw作为一款先进的对话式AI系统,其多轮问答能力依赖于一套精密的答案验证机制。这套机制确保了对话的连贯性、准确性和上下文一致性,是系统核心竞争力的重要组成部分。 1.1 验证机制的技术架构 OpenClaw…

作者头像 李华