Duix.Avatar完全指南:4步本地克隆你的AI数字人,免费生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar是一款完全开源、免费的AI数字人(数字分身)工具:上传一段10秒的视频,就能克隆你的形象和声音,输入文案即可自动生成口播视频。整个过程离线运行在你自己的电脑上:不联网、视频素材不上传第三方服务器、软件费用为0(用户量或营收达到一定规模的企业需签署商业许可协议,详见仓库根目录的LICENSE)。
🎬 它适合谁?先看看是不是你
- 自媒体创作者:批量产出口播短视频,不同平台用不同形象,保持品牌一致
- 企业市场/行政:快速制作产品介绍、内部培训视频,不用约拍摄和后期
- 老师与培训师:统一课程讲师形象,课件一次制作反复使用
- 开发者:本地部署后通过开放API接入自己的业务系统
- 注重隐私的个人:视频和声音素材始终保存在本地硬盘,断网也能用
与商业数字人服务相比,这条路线的总成本是0:不付授权费、不按次收费,唯一的投入是你现有的电脑。
整套工具分两部分:服务端承担全部AI算力(面部识别、声音合成、口型渲染),客户端是纯图形化界面。不想碰代码的你,全程只需敲1条命令,其余都是鼠标点选。
🖥️ 环境准备与一键部署:核对4项配置,5步跑起来
配置要求一览表
| 项目 | 要求 | 说明 |
|---|---|---|
| 系统 | Windows 10(19042.1526及以上)/ Ubuntu 22.04 | 其他Linux版本未做验证 |
| 显卡 | NVIDIA显卡(RTX 30/40/50系列) | 必须正确安装驱动,否则服务无法启动 |
| 内存 | 建议32GB,最低16GB | 16GB可能无法启动ASR服务 |
| 硬盘 | Windows:C盘≥100G + D盘≥30G;Ubuntu:≥100G | C盘存镜像,D盘存模型和作品 |
注意区分lite精简版和完整版:精简版只启动1个视频合成服务,镜像小、占盘少,适合低配机器;完整版启动3个服务,覆盖"克隆形象+声音合成+口型驱动"的完整流程。
Ubuntu装Docker本身很简单,2条命令搞定:
sudo apt update && sudo apt install -y docker.io docker-compose装完用 docker --version 确认版本号,再配置NVIDIA Container Toolkit让Docker能调用显卡(装好后执行 nvidia-smi 能看到显卡信息即成功)。
5步部署步骤
- 更新WSL(Windows专属):未安装过先执行 wsl --install(网络原因失败就多试几次),然后执行 wsl --update
- 安装Docker Desktop:从Docker官网下载安装包,首次运行接受协议并跳过登录
- 获取项目代码:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar- 一键启动服务(在deploy目录执行,下载镜像约70G、耗时约30分钟,建议连WiFi):
docker-compose up -dUbuntu用户改用 docker-compose -f docker-compose-linux.yml up -d;精简版则用 docker-compose -f docker-compose-lite.yml up -d 5. 安装客户端:从项目发布页下载官方安装包,Windows双击 Duix.Avatar-x.x.x-setup.exe 安装,Ubuntu双击 Duix.Avatar-x.x.x.AppImage 直接运行(若打不开,在终端加 --no-sandbox 参数执行)
成功的标志:Docker Desktop中出现3个服务(Duix.Avatar-asr、fish-speech、Duix.Avatar-gen-video),状态全部显示Running。
部署完成后,这3个服务在后台各管一段流程,了解它们的分工,排错时能立刻定位卡在哪一环:
- Duix.Avatar-asr:转写你素材视频里的人说了什么,为声音克隆提供参考文本
- fish-speech:学习你的音色,之后用你的声音朗读任意文案
- Duix.Avatar-gen-video:让模型的口型对齐音频,渲染出最终视频
如果C盘空闲不足100G,可以在Docker Desktop的 Settings → Resources 里,点 Browse 把磁盘镜像的存放位置挪到空间更大的磁盘:
🎥 实战演练:4步做出你的第一个数字人口播视频
素材挑选要点(决定克隆效果)
- 时长:10-20秒最合适,太短特征不够,太长处理变慢
- 声音:视频中的人必须清晰说话,程序用这段声音克隆你的音色,无声视频会直接失败
- 画面:正面角度、光线均匀,不用手和道具挡脸
- 背景:纯色或简单背景,面部识别更稳定
- 格式:MP4、MOV等常见格式都可以
操作4步
- 上传素材:首页点击 Create Avatar,选择准备好的视频,系统自动提取面部和声音特征,约3-5分钟
- 确认形象:训练完成后,My Avatars 列表里会出现你的模型缩略图,可以命名管理
- 写文案:选中模型,输入口播文本,支持中、英、日、韩、法、德、阿拉伯、西语8种语言
- 查看作品:生成完成后到 My Works 列表预览,口型与音频已自动对齐,可直接导出
点击生成后,后台其实走的是三段流水线:TTS服务先用你的克隆音色把文案读成音频,视频渲染服务再让模型口型逐帧对齐音频,最后合成输出。你在客户端看到的进度条,就是按这个顺序往前走的。
客户端首页就是工作区:上方是 Create Avatar(克隆形象)和 Create Video(生成视频)两个入口,下方是模型列表:
My Works 页面汇总你生成的所有口播视频;右上角 Settings 菜单里的 Open Log 可以随时打开客户端日志,排查问题用得上:
🩺 常见问题与排查:5个高频问题一次讲清
1. 启动服务时镜像下载超时
- 现象:执行 docker-compose up -d 报 request canceled、context canceled 等错误。
- 原因:Docker Hub官方镜像源连接不稳定。
- 解决:打开Docker Desktop → Settings → Docker Engine,在JSON配置里加上 registry-mirrors 国内镜像源列表,点 Apply & restart 后重新执行启动命令。Ubuntu则在 /etc/docker/daemon.json 里加同样的配置并重启Docker服务。
2. 创建模特失败,提示视频不可用
- 现象:上传视频、训练环节报错,模型生成不出来。
- 原因:视频没有声音,或声音不是本人在说话。
- 解决:重新录一段10-20秒、本人清晰说话的素材再上传。
3. 定制模特报 Connection refused
- 现象:克隆形象时日志出现 Connection refused。
- 原因:Duix.Avatar-asr服务启动较慢,还没就绪就被调用;内存只有16G的机器可能直接起不来。
- 解决:等3个服务Running后再等2-3分钟开始克隆;仍失败就升级内存到32G。
4. 视频生成进度卡住,或fish-speech容器反复重启
- 现象:进度停在某个百分比(比如20%)长时间不完成,或音频容器一直在重启。
- 原因:音频合成服务内部报错,常见于文件路径或权限问题。
- 解决:打开Docker Desktop,找到对应容器点 Logs 页查看具体报错;客户端侧也可通过 Settings → Open Log 查看日志,两边对照定位。
5. 服务起不来,或Ubuntu上双击客户端没反应
- 现象:3个服务迟迟到不了Running;或Ubuntu上AppImage双击后无响应。
- 原因:前者多半是显卡驱动没装好或磁盘空间不足,本项目全部算力依赖本地NVIDIA显卡;后者以root身份进桌面时,沙箱机制会阻止运行。
- 解决:先执行 nvidia-smi 验证驱动,再检查磁盘剩余空间;Ubuntu改用终端执行 ./Duix.Avatar-x.x.x.AppImage --no-sandbox 启动。
提问前先做3项自查:① 3个服务是否全部Running;② 终端执行 nvidia-smi 能否正常显示显卡信息;③ 客户端和服务端是否都更新到最新版(服务端在deploy目录重跑一次 docker-compose up -d 即可)。
⚙️ 进阶与性能:API批量调用和提速优化
用开放API接入你的业务
Docker启动后,服务端会在本地 127.0.0.1 暴露接口,4个接口串起完整链路,参考实现可直接看对应源码:
| 环节 | 接口 | 作用 | 参考文件 |
|---|---|---|---|
| 模特训练 | 18180端口 /v1/preprocess_and_tran | 返回声音参考信息 | src/main/service/model.js |
| 音频合成 | 18180端口 /v1/invoke | 用克隆音色朗读文案 | src/main/service/voice.js |
| 视频合成 | 8383端口 /easy/submit | 提交音频和视频任务 | src/main/service/video.js |
| 进度查询 | 8383端口 /easy/query | 用任务编号轮询状态 | src/main/service/video.js |
所有接口只监听本地回环地址,局域网内其他设备无法调用,这部分安全性天然有保障。
批量处理的思路很简单:把模型训练接口返回的参考信息存好,之后每条文案都按"音频合成 → 视频合成 → 轮询到完成 → 保存成品"的固定套路走。写个小脚本或挂个定时任务,就能让数字人夜间自动产出几十条口播视频。
硬件与速度参考
| 档位 | 显卡 | 内存 | 速度参考 |
|---|---|---|---|
| 入门 | RTX 3060 12G | 16G | 每个视频几分钟 |
| 推荐 | RTX 4070 12G | 32G | 每个视频约1-2分钟 |
| 专业 | RTX 4090 24G | 64G | 每个视频1分钟内 |
显存只有8G的机器,建议先用lite版跑通完整流程,确认效果后再决定是否升级硬件。
让生成更顺手的3个习惯
- 模型和作品放在SSD上,加载和写入速度明显更快
- 保持NVIDIA驱动更新;50系列显卡可直接使用deploy目录里的 docker-compose-5090.yml 专属部署配置
- 生成前关闭占用GPU的后台程序
关于容量:模型和作品都存在本地硬盘(Windows为D盘),30G足够放几十个模型;空间紧张时,删掉不用的模型即可立刻释放空间。
✅ 现在就开始
今天就能做的一件事:用手机录一段10秒的正面说话视频,部署完服务后拿它当第一个模特素材,半小时后你就能拥有第一段数字人口播视频。中途卡住时,优先查官方文档 doc/常见问题.md 和 deploy/ 目录,再到项目Issues列表搜索——社区每天在处理问题单,大概率已有现成答案。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考