三步快速跑通 Duix.Avatar:离线数字人视频生成部署指南
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
下午想出一条口播视频,却不愿等云服务排队,更不想把真人素材传到外部平台。Duix.Avatar 是全离线的开源数字人项目:上传一段10 秒左右的视频即可克隆形象与声音,输入文案就能自动产出口型匹配的视频,算力全部在本地,支持8 种语言、免费商用。
✅ 它适合谁、不适合谁
这个项目用"本地 NVIDIA 显卡 + 32G 内存 + 约半小时首次等待",换"全离线、不限次、可商用"的口播视频生产。
- 批量产出数字人口播、且素材隐私敏感的人(全流程离线,素材不出机器)
- 想把数字人合成能力接进自家产品的开发者(Docker 启动后在
http://127.0.0.1开放合成与训练接口) - 商用场景:全球免费商用,仅用户量超 10 万或年营收超 1000 万美元的企业需另签许可协议
没有 NVIDIA 显卡、内存不足 32G 的机器,以及需要实时交互数字人的需求(本项目只做非实时视频合成),不建议投入本地部署。
📋 部署前最低配置核对表
部署前把这张表核完,后面 90% 的报错都与它有关。
| 核对项 | 最低要求 | 备注 |
|---|---|---|
| 系统 | Windows 10 19042.1526+ 或 Ubuntu 22.04 Desktop | 其他 Linux 版本未做兼容验证 |
| 显卡 | NVIDIA 显卡且驱动装好 | 缺卡或缺驱动服务起不来,用nvidia-smi验证 |
| 内存 | 32G 及以上 | 16G 可能导致 ASR(语音识别)服务起不来 |
| 磁盘(Windows) | C 盘空闲 >100G,D 盘空闲 >30G | C 盘存镜像文件,D 盘存数字人与作品数据 |
| 运行环境 | Docker(Windows 需先装 WSL) | 首次启动自动拉取镜像,约 70G 流量 |
🚀 三步跑通最小可用服务
准备:拉代码,核对磁盘与显卡
这步把代码和硬件就绪状态确认到位。
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar安装好 Docker 与 NVIDIA 驱动后,运行nvidia-smi。完成标志:命令正常打印显卡信息,且磁盘空闲空间达到上表要求。
启动:一条命令拉起服务
这步会自动下载镜像并启动服务,耗时约半小时,注意连 WiFi。
cd deploy docker-compose up -d只需视频合成能力时改用docker-compose -f docker-compose-lite.yml up -d。完成标志:Docker 中出现三个服务且均为 Running 状态(Lite 版只有一个,名为 duix-avatar-gen-video)。
验证:打开客户端确认连接
下载官方构建的安装包,Windows 双击 exe 安装,Ubuntu 直接运行 AppImage 文件。完成标志:客户端首页正常显示"My Works / My Avatars"两个列表,无连接报错。
客户端首页:上方是"Create Video"视频合成与数字人形象创建入口,下方为"My Works"与"My Avatars"列表
📊 资源占用与效果
标准版拉三个容器,Lite 版只留一个;是否需要"文字转语音"环节是选择依据。
| 对比维度 | 标准版 | Lite 版 |
|---|---|---|
| 服务容器 | 3 个:TTS(语音合成)、ASR(语音识别)、视频合成 | 1 个:视频合成 |
| 暴露本地端口 | 18180、10095、8383 | 8383 |
| 启动命令 | docker-compose up -d | docker-compose -f docker-compose-lite.yml up -d |
| 覆盖能力 | 形象克隆 + 语音合成 + 视频合成 | 仅视频合成 |
翻译一下:手里已有现成音频、只想要对应数字人视频时,Lite 版少下载、少启动两个容器;需要直接输入文字驱动口型,用标准版。
🎬 三步之后:跟着做一个最小示例
我用最短流程完整走一遍。
- 客户端点击"Create Avatar",上传一段 10 秒正面人像视频(背景干净、人在说话);预期:完成后"My Avatars"里多出一个新模型。
- 点击"Create Video",选中刚创建的模型,输入一段产品介绍文案(文案共支持 8 种语言)。
- 提交合成,等待进度走完;预期:进度条结束不报错。
- 回到"My Works",播放并下载生成的口播视频。
"My Avatars"页签下展示新克隆的数字人形象模型卡片及其创建时间
🔧 最容易卡住的 3 个地方
- 现象:
docker-compose up -d报 registry-1.docker.io 连接超时。原因:Docker Hub 官方源不稳定。解决:在 Docker Desktop 的 Docker Engine 设置里配置国内镜像源,示例见 常见问题。
Docker Desktop 的 Docker Engine 设置页,registry-mirrors 字段填入镜像源列表
- 现象:新增模特时报错。原因:建模视频必须带声音且是人在说话。解决:重拍一段说话清晰的 10 秒视频再上传。
- 现象:定制模特报 Connection refused。原因:ASR 服务启动慢,或机器内存太小。解决:服务端启动后等几分钟再操作;内存升到 32G 以上。
Duix.Avatar 把口播视频的生产门槛压到"一台带 NVIDIA 显卡的电脑 + 半小时等待"。部署跑通后,可按 README_zh.md 的接口说明把合成能力接入自己的产品;提问前建议先对照 doc/常见问题.md 自查。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考