Duix.Avatar 完整指南:离线克隆数字人形象与声音,零成本生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
录一条 1 分钟的口播视频,要化妆、布光、录音、剪辑半天?Duix.Avatar 是一个完全开源、可离线运行的 AI 数字人工具箱,用一段真人视频就能克隆你的形象和声音,之后只需输入文字就能产出说话视频,全程不联网,三个服务跑在一块 NVIDIA 显卡上即可。
一分钟读懂:Duix.Avatar 能做什么
它解决的是一件事:把你的形象和声音变成一台 7x24 小时在线的"数字分身",你用文字或语音驱动它说话,它自动生成口型对齐的视频。
适合谁:
- 内容创作者:不想反复出镜,用文字批量产出口播视频;
- 企业团队:需要内部培训、课程录制,数据不能上云;
- 开发者:想拿一套开源 API 做自己的数字人产品。
关键数据:官方把数字人制作成本从传统 3D 方案的高额投入压到约 1000 美元级别,并已支撑 1 万+ 企业、50 万个个性化形象;脚本支持中、英、日、韩、法、德、阿、西 8 种语言。
核心机制拆解:一段视频如何变成你的数字人
整个仓库是"桌面客户端 + 三个本地 AI 服务"的结构,代码入口在 src/main/。
声音克隆:让 TTS 服务"学会"你的嗓音
打个比方:就像给配音演员做嗓音采样。你上传的视频里有人声,客户端先用 ffmpeg 把音轨抽出来(见 src/main/util/ffmpeg.js),再通过127.0.0.1:18180/v1/invoke交给 fish-speech 语音克隆服务,生成一个专属说话人。之后任何文字,都能用"你的声音"念出来。相关调用封装在 src/main/service/voice.js 和 src/main/api/tts.js。
形象克隆:从一条视频拆出"脸 + 声"
打个比方:像把一枚硬币扫成 3D 存档。你在客户端新建 Avatar 时,src/main/service/model.js 会先把原视频统一转成 H.264,再用 ffmpeg 分离出无声视频和 wav 音频,前者交给 face2face 视频服务做人脸建模,后者走上一条的语音克隆流程,最后把两条产物的 ID 一起写进本地 SQLite 数据库(src/main/dao/)。
视频合成:文字怎么变成口型对齐的视频
打个比方:文字先变成"你的声音",声音再驱动"你的脸"张嘴。src/main/service/video.js 负责编排整个流水线:文字 → 本地 TTS 生成音频 → 调127.0.0.1:8383/easy/submit提交视频合成任务 → 轮询进度直到完成。任务状态存在本地数据库,即使中途重启,src/main/interval/interval.js 的定时轮询也会把没跑完的任务续上。
横向对比:本地部署 vs 在线 API 数字人
| 维度 | 在线 API 数字人 | Duix.Avatar 本地部署 |
|---|---|---|
| 网络依赖 | 必须联网,数据出内网 | 完全离线,素材不离开本机 |
| 硬件要求 | 无,买算力即可 | 需 NVIDIA 显卡,推荐 RTX 4070 / 32G 内存 |
| 定制化 | 只能用对方接口,改不了算法 | 源码全开放,可改模型、换 TTS、扩展 API |
| 成本结构 | 按调用量付费,长期成本高 | 一次部署长期使用,零调用费用 |
| 商业授权 | 随服务付费 | 支持全球免费商用(超大规模企业需签商业授权) |
结论很直接:数据敏感或长期高频使用,本地部署的总成本优势明显;只是临时尝鲜,在线 API 更快。
从 0 到 1:5 步生成第一条数字人视频
以 Windows 为例,Ubuntu 22.04 流程类似,配置见 deploy/ 目录下的多个 docker-compose 文件。
- 装好 Node.js 18 和 Docker Desktop(WSL2),确认
nvidia-smi能显示显卡信息; - 拉取三个镜像:
guiji2025/fun-asr、guiji2025/fish-speech-ziming、guiji2025/duix.avatar; - 进入
deploy目录执行docker-compose up -d,首次下载约 70GB 流量,耐心等待约半小时; - 看到 3 个服务全部 Running 即部署成功,安装 Electron 桌面客户端并登录本机服务;
- 上传 1 段正面真人视频"新建 Avatar"训练形象与声音,再进"Create Video"输入文字,等待合成即可导出视频。
想自己改代码跑客户端,先克隆仓库:git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar,然后npm install && npm run dev。
本地部署的 5 个常见坑与正确做法
- **误区:没有 NVIDIA 显卡也硬装,服务起不来。**|正确做法:三个服务全部依赖 GPU 计算,部署前先跑
nvidia-smi确认驱动正常,这是官方 FAQ 的第一自检项。 - **误区:把服务跑在 C 盘,空间不足。**|正确做法:Windows 下 D 盘预留 30GB+ 存数字人数据、C 盘预留 100GB+ 存镜像;Docker 数据目录可手动改到其他盘。
- **误区:客户端报错就重装。**|正确做法:先按 doc/常见问题.md 的模板取日志——客户端日志在设置面板可导出,服务端日志看对应容器的 Logs 页,再对照 Issues 提问。
- **误区:客户端和服务器版本不一致。**|正确做法:项目更新频繁,遇到先升再查——服务端在
deploy目录重跑docker-compose up -d,客户端拉最新代码重新 build。 - **误区:50 系显卡直接用旧版 compose 文件。**|正确做法:5090 等 50 系 GPU 要用官方 PyTorch 预览版方案,对应
deploy/docker-compose-5090.yml,30/40 系搭配 CUDA 12.8 也可用。
谁适合用,接下来会发生什么
适合有两类人:要"零成本批量产出口播视频"的创作者,以及"素材不能上云、要掌控全链路"的技术团队。
接下来可以关注三件事:客户端已支持 Ubuntu 22.04 桌面版并加入英文界面,跨平台覆盖在扩大;50 系显卡适配已完成,硬件门槛继续下探;模型训练与视频合成均已暴露本地 HTTP API(127.0.0.1:8383/:18180),方便把它嵌进自己的业务系统。
Duix.Avatar 把数字人克隆从"买服务"变成"装软件":开源、离线、全链路可控。装好它,你的第一条口播视频只需要一段文字。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考