三步完成 Duix.Avatar 本地部署:从零克隆你的数字人生成第一条口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
你有一段现成文案,想用自己的脸和声音做口播视频,但又不想每次对着镜头重拍。Duix.Avatar 是一款免费开源的数字人视频项目:提交一段 10 秒左右视频即可完成形象与声音克隆,输入文本或音频就能自动生成口型对齐的播报视频。全程基于 Docker 本地部署,跟着做完你就能产出第一条数字人视频。
一句话看懂:开源数字人视频工具能帮你做什么
Duix.Avatar 由服务端和客户端两部分组成:服务端是三个 Docker 容器,分别负责语音识别(ASR)、声音克隆合成(TTS)和视频合成;客户端是图形化桌面程序,负责上传素材和查看成片。所有算力都在你自己机器上离线完成,不联网也能跑。它最适合内容创作者、培训视频制作者,以及想通过 API 做二次集成的开发者。
| 能力 | 对你的意义 |
|---|---|
| 10 秒视频克隆形象 + 声音 | 不用 3D 建模、不用摄影棚,人人都能拥有数字分身 |
| 文本 / 音频驱动口型 | 写完文案直接出片,支持中、英、日、韩等 8 种语言 |
| 全离线本地计算 | 视频和声音数据不出内网,隐私自己可控 |
| 开源免费商用 | 个人和小团队零授权成本,见 LICENSE |
部署前检查:硬件与软件要求
先花两分钟核对配置,这是后面所有报错的源头。不满足最低配置时,容器会起不来或训练中途失败,装好也白装。
硬件要求:
| 项目 | 最低配置 | 推荐配置 | 不满足的后果 |
|---|---|---|---|
| 显卡 | NVIDIA 显卡,显存 ≥8GB | RTX 4070 及以上 | 无 NVIDIA 显卡时三个容器全部无法启动 |
| 内存 | 16GB | 32GB 及以上 | 16GB 时 ASR 服务可能直接启动失败 |
| 磁盘 | 100GB 空闲(存镜像) | 150GB 以上 | 70GB 镜像下载到一半中断,前功尽弃 |
| Windows 数据盘 | D 盘 ≥30GB(存数字人数据) | 50GB 以上 | 训练素材和成片无处落盘 |
软件要求:
| 项目 | 要求 | 说明 |
|---|---|---|
| 系统 | Windows 10 19042.1526+ 或 Ubuntu 22.04 桌面版 | 其他 Linux 版本官方未做兼容验证 |
| Docker | Docker Desktop(Windows)或 Docker Engine + compose(Linux) | 服务端完全靠容器运行 |
| 显卡驱动 | nvidia-smi能看到显卡信息 | Linux 还需额外安装 NVIDIA Container Toolkit |
Windows 用户注意:Docker 镜像默认存在 C 盘。如果 C 盘不足 100GB,安装 Docker 后进入 Settings → Resources → Advanced,把 Disk image location 改到空间充足的磁盘再点 Apply & restart。
部署 🚀:三步完成 Duix.Avatar 本地部署
第一步:克隆源码
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar成功标志:目录里能看到deploy/(内含 4 个 compose 文件)和src/(客户端源码)。你不做客户端开发的话,真正要用到的只有deploy/目录。
第二步:启动服务端容器
cd deploy docker-compose up -d这一步会拉取三个镜像,合计约 70GB,下载期间终端基本无输出,持续十几到三十分钟属正常现象,耐心等。RTX 5090 显卡改用docker-compose -f docker-compose-5090.yml up -d;Ubuntu 用-f docker-compose-linux.yml;只要口型驱动、不做克隆就用轻量版-f docker-compose-lite.yml up -d(只起视频合成一个服务)。
下载完成后,用这两条命令验证:
nvidia-smi docker ps --format "{{.Names}}: {{.Status}}"成功标志:nvidia-smi能打出显卡信息(驱动没问题);docker ps输出三行且状态都是Up:duix-avatar-tts(18180 端口)、duix-avatar-asr(10095 端口)、duix-avatar-gen-video(8383 端口)。看到这三个服务 Running,服务端就部署成功了。
第三步:安装并启动客户端
Windows 用户从项目发布页下载Duix.Avatar-x.x.x-setup.exe,双击按向导安装;Ubuntu 用户下载 Linux 版AppImage后执行:
chmod +x Duix.Avatar-x.x.x.AppImage ./Duix.Avatar-x.x.x.AppImage --no-sandbox成功标志:客户端打开后看到 Home 主页,顶部是 "Create Video"(AI 视频生成)和 "Create Avatar"(创建数字人)两个入口,说明客户端已能连上本地服务端。
动手实践:产出你的第一条数字人视频
现在做一条完整任务线:先创建一个数字人,再用文本驱动生成第一条视频,最后用音频驱动生成第二条。全程只在客户端里点,不需要碰代码。
- 创建数字人:Home → 点 "Create Avatar" → 上传一段 10 秒左右的视频。要求:人脸居中清晰、光线均匀、全程有人说话(声音会被用来克隆音色)。提交后等待训练,视显卡不同约 1~3 分钟。成功后 "My Avatars" 列表出现新模型,缩略图取自你的视频。训练视频没有音轨会直接报错,这是新手最高频的坑。
- 文本驱动,生成第一条视频:Home → 点 "Create Video" → 选中刚建好的数字人 → 输入文案(支持 8 种语言)→ 确认音色与语速 → 开始生成。进度条走完需要几十秒到几分钟,取决于显卡和文案长度。完成后在 "My Works" 列表下载播放,重点听口型是否跟着语音走。
- 音频驱动,生成第二条视频:再次进入 "Create Video" → 这次改用音频上传入口,选一段你自己的录音(或从任意成品视频里抽出的音频)→ 提交。系统会按音频的节奏和语调对齐口型,产出的第二条视频用的就是你的原声,音色比文本驱动更自然。
- 素材决定上限:10 秒左右、正脸、均匀光线、纯色背景、连续自然说话,克隆效果会明显更稳定;背景复杂或人脸过暗时,先换素材再怀疑软件。
- 服务端刚启动完的几分钟内别急着训练:ASR 服务就绪偏慢,遇到
Connection refused等几分钟重试即可,不是部署失败。- 想做批量或二次开发,直接读 src/main/service/ 下 model.js、video.js、voice.js,就是模型训练、音频合成、视频合成的完整调用流程。
进阶:素材质量、GPU 加速与 API 集成
素材要点:训练视频记住四个字——清晰、稳定;音频记住两个词——安静、自然。10 秒足够,但别为了凑时长录进停顿和杂音。
GPU 与存储:三个容器都声明了runtime: nvidia,部署前先跑nvidia-smi确认显卡可用,否则容器起不来。RTX 5090(以及 30/40 系 CUDA 12.8 环境)走deploy/docker-compose-5090.yml。生成速度主要受显存限制,8GB 显存可跑,12GB 以上更从容。
API 集成:服务端起来后会在本机暴露三个端口,最常用的是 8383 的视频合成。最短的一次提交 + 一次查询:
curl -X POST http://127.0.0.1:8383/easy/submit -H "Content-Type: application/json" \ -d '{"audio_url":"D:/duix_avatar_data/face2face/audio.wav","video_url":"D:/duix_avatar_data/face2face/video.mp4","code":"task-001","chaofen":0,"watermark_switch":0,"pn":1}' curl "http://127.0.0.1:8383/easy/query?code=task-001"code是你自定义的任务唯一标识,提交后用同一个 code 轮询进度直到完成。声音克隆合成(18180 端口/v1/invoke)和模特训练接口的完整参数,参考 src/main/service/voice.js 与 src/main/service/model.js,无需自己拼协议。
常见问题:数字人视频生成避坑清单
| 现象 | 原因 | 解决与关键排查命令 |
|---|---|---|
docker-compose up -d十几秒即超时,报context canceled | Docker Hub 官方源连接不稳定,镜像拉不下来 | 在 Docker 设置中配置 registry-mirrors 镜像源(见下图)后重试,再用docker images确认三个镜像齐全 |
| 服务起不来或反复重启 | NVIDIA 驱动未装或未生效,容器拿不到 GPU | 装好驱动,nvidia-smi能显示显卡信息后再docker-compose up -d |
定制模特训练报Connection refused | ASR 服务启动慢,调用时还没就绪 | 服务端启动后等 5 分钟再重试,先docker ps确认三个服务均 Running |
| 新增模特报错,提示视频必须有声音 | 上传的训练视频无音轨或无人说话 | 重录 10 秒左右有人连续说话的视频,可用ffmpeg -i 视频.mp4确认存在音频流 |
| 客户端显示无法连接本地服务 | 服务未全部 Running,或 18180/10095/8383 端口被占用 | docker ps看状态,docker logs duix-avatar-gen-video看日志定位(见下图) |
三个容器都 Running 之后,你的 Duix.Avatar 本地部署就真正完成了:后续每次产出数字人视频只是在客户端里点几下,数据全程不出内网。遇到问题先查 doc/常见问题.md 这份官方排错清单,容器参数和硬件适配方案看 deploy/ 下的四个 compose 文件,版本更新与社区动态以 README_zh.md 为准。现在就打开终端跑一遍nvidia-smi,把第一个 70GB 的镜像拉下来吧。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考