用10秒视频克隆你的AI数字人:口播视频生成全在本地跑
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一个完全离线的AI数字人开源项目:上传一段10秒视频即可完成数字人克隆,输入文案就能生成口播视频,全程在你的电脑上运行。适合自媒体创作者、培训讲师,以及不想把面部声音交给云端的开发者。
它帮你解决什么问题
- 文案一改就要重新录制。你作为自媒体作者,一条3分钟口播视频说错一句就得重录;换个选题,还得换场地重新拍。克隆数字人后,只改文案,视频随时重新生成。
- 外包贵、在线工具有隐私顾虑。定制3D数字人传统上要数万元,SaaS平台则要你把脸和声音传到别人的服务器。Duix.Avatar 全程本地运行,数据不出你的电脑。
- 非技术同学不知道从哪下手。服务端一条 compose 命令拉起来,客户端是双击即开的应用,界面只有“创建数字人”和“创建视频”两个入口。
核心能力一览
- 形象与声音克隆——上传一段带说话声音的10秒视频,得到一个可反复使用的数字人模型。
- 文字驱动口播视频生成——输入文案,自动合成语音、对口型,输出成片。
- 语音驱动——直接上传音频文件,用你自己的语气节奏让形象说话。
- 多模型管理——导入多个数字人,一键切换,按不同选题批量出片。
- 八种语言文案——中、英、日、韩、法、德、阿、西语都支持。
- 本地开放 API——模型训练与视频合成接口在本地端口暴露,方便接入自己的系统。
图:客户端主界面,上方是“Create Video / Create Avatar”两个功能区,下方为数字人模型列表
5分钟跑通部署
前置条件:Windows 10(19042 以上)或 Ubuntu 22.04;NVIDIA 显卡并装好驱动(显存 8GB 以上更稳妥);Docker 镜像所在磁盘(默认 C 盘)留 100GB 以上,数据盘(默认 D 盘)留 30GB 以上。
第 1 步,克隆仓库:
# 克隆项目(唯一用到的外部操作) git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar第 2 步,启动服务端:
# 进入 deploy 目录,一条命令拉起全部 3 个服务(lite 版换 docker-compose-lite.yml) cd Duix-Avatar/deploy && docker-compose up -d⚠️ 命令本身 5 分钟搞定,但首次拉镜像约 70GB 流量、耗时半小时左右,记得连 WiFi。
第 3 步,安装客户端:Windows 双击官方包的Duix.Avatar-x.x.x-setup.exe;Ubuntu 双击Duix.Avatar-x.x.x.AppImage启动,root 用户需改用终端命令./Duix.Avatar-x.x.x.AppImage --no-sandbox。
确认跑通:Docker 页面看到 duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video 三个容器均为 Running(lite 版只有 gen-video 一个),再打开客户端能进入主界面即可。
底层是怎么做到的(通俗版)
整条流水线像三个人分工,各跑在 Docker 服务里:
- 识别(ASR):听你上传视频里的说话声,转写成文字,这份转写是声音克隆的参照材料。
- 语音合成(TTS):从几秒音频里学你的音色,之后用你的语气朗读任意文案。
- 视频合成:把合成音频叠到原视频画面上,驱动嘴部跟随声音动,输出成片。
客户端只是把这些请求转发给三个服务并跟踪进度的“调度员”,任务流转见 src/main/service/video.js,三个服务的端口与参数定义在 deploy/docker-compose.yml。
配置与性能参考:最低/推荐两档
| 项目 | 最低配置 | 推荐配置 | 体验差异 |
|---|---|---|---|
| CPU | 4 核通用处理器 | 13 代 Intel i5-13400F 及以上 | 核数越多,客户端操作与任务排队越顺 |
| 内存 | 16GB | 32GB(官方标注必要) | 16GB 时 ASR 服务可能起不来 |
| 显卡 | 8GB 显存的 NVIDIA 卡(社区反馈可用) | RTX 4070 | 显存更高,能扛更长视频与更高输出分辨率 |
| 存储 | 镜像盘 100GB + 数据盘 30GB 空闲 | NVMe SSD | 首次镜像约 70GB,SSD 大文件读写更快 |
踩坑与排错
镜像下载慢、连接失败
- 现象:
docker-compose up -d报request canceled、超时类错误。 - 原因:国内直连 Docker Hub 官方源不稳定。
- 解法:在 daemon.json 的 registry-mirrors 添加国内镜像源,重启 Docker 再执行。
图:Docker 镜像加速源配置位置,添加后重启 Docker 生效
服务启动失败、容器反复重启
- 现象:三个容器中某个起不来或不停重启。
- 原因:项目算力全在 GPU——没有 NVIDIA 显卡、没装驱动,或镜像盘空间不足。
- 解法:用
nvidia-smi确认显卡;磁盘紧张时,在 Docker Desktop 的 Settings → Resources → Advanced 里把 WSL 磁盘镜像位置改到空间更大的盘。
图:Docker Desktop 中更改 WSL 磁盘镜像位置的入口(红框处 Browse 选择新磁盘)
显存不够、视频生成失败
- 现象:生成任务报显存不足而失败。
- 解法:调低输出分辨率或缩短单次时长;或改用 lite 版,只保留视频合成服务(
docker-compose -f docker-compose-lite.yml up -d)。
模型克隆失败
- 现象:上传视频报错,或服务刚起来就报 Connection refused。
- 原因:克隆视频必须包含人声(声音是克隆素材);ASR 服务启动慢,16GB 内存可能带不动。
- 解法:重录一段 10 秒以上、人声清晰的视频;服务端启动后等几分钟再操作;内存 16GB 建议升到 32GB。
端口冲突
- 现象:容器都起来了,客户端却连不上本地服务。
- 原因:18180、10095、8383 端口被其他程序占用。
- 解法:在 deploy/docker-compose.yml 中改端口映射左侧数字(如 18180 改 18181),右侧容器端口不动。
仍定位不了?打开三个容器的 Logs 页,点右侧复制图标把完整报错文本提出来。
图:Docker 容器日志页,右侧复制图标可提取完整报错文本
适合谁、怎么用
- 自媒体创作者:克隆自己一次,同一选题批量出同音色的口播视频,不用反复换场地。
- 培训与课程:把标准化课纲做成固定形象的口播视频,多期学员反复复用。
- 二次开发者:直接调用本地开放 API,把“输文案 → 出视频”嵌进自己的产品。
进阶方向:
- 50 系显卡(30/40 系 cuda 12.8 环境也可试)可换 5090 专用 compose 文件部署。
- 熟悉模特训练、音频合成、视频合成三个本地接口后,可搭自己的批量生成流水线。
Duix.Avatar 把“录一条口播视频”变成“输文案 → 拿成片”的本地流程,全程不出你的电脑。硬件满足的话,建议先克隆一个自己的模型试跑一遍。更多细节看官方文档:doc/常见问题.md
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考