10秒视频做出数字分身:用 Duix.Avatar 本地部署 AI 数字人的完整上手指南
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款免费开源的AI 数字人工具,支持本地部署:上传一段 10 秒左右的真人视频,它就能同时克隆你的形象和声音,之后输入一段文字或上传一段音频,即可自动生成口型匹配的播报视频。全程在自家电脑离线跑完,适合想做口播内容的创作者,也适合想在自己机器上玩数字人克隆、又不想把素材交给云端的人。
它能帮你做成什么事:能力清单 + 路线对比
先说清楚它到底能干哪些活,再决定值不值得折腾:
- 一段视频出两个分身:上传 10 秒说话视频,系统自动分离画面和声音,形象克隆、声音克隆一次完成,不用分别训练
- 文字直接变视频:写好文案点生成,系统自动配音并把口型对齐,产出成品口播视频
- 音频直接驱动:不用写文案,上传自己录好的音频(甚至配音员的干声),数字人照着说
- 一个模特反复用:形象建好后存在本地,可以反复生成多个作品,也支持同时维护多个模特
- 多语言文案:脚本支持中、英、日、韩、法、德、阿拉伯语、西语 8 种语言
- 全离线运行:所有算力都在本地,脚本、人脸、声音都不出你的机器
- 开放 API:模特训练、音频合成、视频合成的接口都对
127.0.0.1开放,可以直接接进你自己的系统,调用示例见 src/main/service/
那该走哪条路线?看你的身份:
| 你的情况 | 建议路线 |
|---|---|
| 有英伟达显卡、爱折腾、要改代码深度定制 | 本地部署 Duix.Avatar 开源版(本文路线) |
| 不想买 GPU、专注业务集成、要稳定商用保障 | 官方数字人/克隆音 API 接口服务 |
本文只讲本地部署这条线。硬件门槛先亮出来:必须有英伟达显卡和驱动,推荐 i5-13400F + 32G 内存 + RTX 4070,内存低于 32G 大概率起不来。
裸机走通:从装环境到第一条数字人视频
这条链路走下来大约一两个小时,大部分时间在等镜像下载,你真正动手的只有十几次点击和几条命令。
先过硬件自检。装好显卡驱动后,在终端执行nvidia-smi,能显示出显卡信息才算数——本项目所有算力都在本地,没有英伟达显卡,后面三个服务都起不来。磁盘方面,Windows 机器要求有 D 盘且空闲 30G 以上(存数字人和作品),C 盘空闲 100G 以上(存镜像)。C 盘不够的话,装好 Docker 后在设置里把镜像目录挪到大磁盘:
装 WSL 和 Docker Desktop。终端里wsl --install(网络原因可能失败,多试几次,中途设置的用户名密码要记住),再wsl --update更新一下,然后从 Docker 官网下载安装包,按提示接受协议、跳过登录即可。
拉起来三个 AI 服务。把仓库 clone 下来(需要时执行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar),进入deploy目录执行docker-compose up -d。接下来约半小时、70G 左右的镜像下载,记得连 WiFi。判定成功的标准很直白:Docker 里出现 tts、asr、gen-video 三个服务且都是 Running 状态。
装客户端,做第一条视频。Windows 从官方 Releases 下载Duix.Avatar-x.x.x-setup.exe双击安装;Ubuntu 用 AppImage 直接运行。打开客户端,点"创建数字人"上传一段 10 秒左右、有清晰人声的视频,起个名字,等形象训练完成;再点"创建视频",输入一段文案,提交生成。作品列表里能看到进度条,跑完后直接预览、导出。
核心流程拆解:10 秒视频是怎么变成数字人的
上传的视频为什么必须有人声。很多人栽在这里:上传的是一段无声 B-roll,结果建模特直接报错。原因很简单——声音克隆就靠这段视频里的声音,程序会用 ffmpeg 把音频从视频里抠出来送去做语音训练,没有声音就没有参考音频。所以录的时候记得对着镜头正常说话,10 秒左右即可。
文字和音频两条路进同一条流水线。你输入的文字会先发给本地 TTS 服务(端口 18180),用你克隆的声音合成语音;你上传的音频则直接使用。接着音视频一起送给视频合成服务(端口 8383)做口型对齐。任务不会同时开工,而是进队列逐个处理,界面上能看到"第 x / 共 y 个"的排队位置和实时进度,所以一次提交一整天文案也完全没问题。
模特与作品是两套独立的管理。模特(形象)支持分页、搜索、删除,删模特会连同它的视频和参考音频一起清掉;作品(成品视频)同样可以预览、改名、导出到指定路径、删除。想深挖接口细节,模特训练在 src/main/service/model.js,视频合成与队列轮询在 src/main/service/video.js。
三个实战场景:装好之后你能做什么
个人 IP 口播账号。形象建一次,长期复用。以后每天的内容就变成"写文案 → 点生成",不用出镜、不用补录,一天更新几条也不累人。
课程、培训视频的批量制作。把长文案直接丢进去,队列系统会按顺序一条条渲染。晚上提交一批次日的课程视频,早上起来全部导出发走,是最典型的用法。
不爱露脸的商业口播。产品介绍、本地商家宣传,可以请一位配音员录干声,走"音频驱动"路线,数字人照着念,既统一形象又保留人声的细腻度。
按机器调优:进阶配置与跨平台差异
配置比较弱的机器。用 lite 版 compose 文件:在deploy目录执行docker-compose -f docker-compose-lite.yml up -d,只启动视频合成一个服务,省显存。
50 系新显卡(含 5090)。官方已适配,同样在deploy目录执行docker-compose -f docker-compose-5090.yml up -d;30、40 系用 CUDA 12.8 的也可以走这套。
Ubuntu 22.04 用户。装好 docker.io、docker-compose 和 NVIDIA Container Toolkit 后,执行docker-compose -f docker-compose-linux.yml up -d即可;客户端用 AppImage,root 用户下运行记得加--no-sandbox参数。
镜像拉取慢。在 Docker 设置的 Docker Engine 里加国内镜像源registry-mirrors,改完 Apply & restart:
数据存放位置。Windows 下数字人与作品数据默认落在D:\duix_avatar_data,语音参考文件目录可在 deploy/docker-compose.yml 里按需修改。另外社区里有 8G 显存可用的单镜像整合玩法(见 README 共创作品展),硬件吃紧可以先去翻翻。
排障手册:最容易翻车的四个问题与解法
docker-compose up -d报连接失败 / request canceled。Docker Hub 官方源不稳定,两个办法:开全局代理,或者按上一节配国内镜像源。
新增模特报错(提示 file 不存在之类)。九成是上传视频里没有人声,回去换一段"人在说话"的视频重建。
定制模特报 Connection refused(funasr 连接异常)。ASR 服务冷启动很慢,服务刚起来就操作会被拒连——等服务全部 Running 后再等几分钟再克隆。另外 16G 内存的机器可能根本起不动,这是 32G 起步的硬原因。
三个服务状态不对 / 怀疑显卡。按顺序查:nvidia-smi是否显示显卡 → 驱动是否最新 → 到deploy目录重新执行docker-compose up -d拉最新版 → 再看 常见问题文档 里有没有同款问题。
卡住时,先学会抓两边的日志。客户端:右上角设置菜单点"打开日志",日志文件在AppData\Roaming\heygem.ai\logs下的main.log;
服务端:在 Docker Desktop 点开对应容器的 Logs 页签,直接点复制图标把日志拷出来,配合报错时间戳去找问题:
开始前的边界提醒
克隆自己的形象和声音、用于个人创作与研究,是它的主场;未经本人同意不要克隆他人的脸和声音,不要用数字人产出误导性的商业内容。商用前请读一遍 LICENSE 与仓库内的模型社区许可协议——用户量超 10 万或年营收超千万美元的企业需要签署商业许可。也因为全离线运行,你的脚本和素材天然不落外网,隐私上是加分项。
今晚就开始:做出第一条数字人视频
一句话收束:一段 10 秒视频、一下午的部署时间,换来一个 7×24 小时在线的"数字分身",文案进、视频出,从此不靠出镜。现在就剪一段自己说话的 10 秒视频存好,按上面的链路把环境搭起来,今晚就能看它开口说话。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考