Duix.Avatar开源数字人本地部署:10秒视频克隆形象与声音
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar是一个免费开源的AI数字人项目,支持本地部署与API调用,全部计算在本机完成,运行过程不依赖外网。它解决的问题是:数字人商业服务收费高、素材需要上传云端。给出一段10秒左右的人脸说话视频,它能克隆这个人的外貌和声音;再输入文案或上传音频,即可生成口型同步的口播视频。最终产出是一个形象、音色均克隆自原素材的成片视频文件。客户端界面支持中、英、日、韩等8种语言。
效果先行:输入一段视频,得到一条口播视频
输入:一段10秒左右、人脸清晰可见且带说话声音的视频。输出:数字人朗读指定文案的视频,或由上传的音频直接驱动的成片。整个流程不经过任何云服务。
开始前需要确认的三件事
| 事项 | 内容 |
|---|---|
| 开源授权与部署形态 | 采用DUIX.COM社区协议,可免费商用;产品月活超过1000需向官方申请商业授权。服务端通过Docker运行asr、tts、gen-video三个服务(lite版仅一个),客户端为桌面程序 |
| 硬件最低要求 | 英伟达NVIDIA显卡及正确驱动(必需);内存32G及以上(必需);Windows需D盘空闲30G以上、C盘存镜像需100G以上,Ubuntu需100G以上空闲磁盘;首次拉取镜像约70G流量 |
| 关键使用限制 | 全部算力依赖GPU,无NVIDIA显卡或未装驱动则服务无法启动;用于创建形象的视频必须有说话声;16G内存可能不足以启动服务 |
部署:从克隆代码到服务就绪
- 获取代码并进入部署目录:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy准备Docker与GPU支持。Windows:用
wsl --list --verbose检查WSL(未装则wsl --install),执行wsl --update更新,再安装Docker Desktop;C盘空闲不足100G时,在Docker的Settings → Resources → Disk image location把镜像存储改到空闲大于100G的磁盘。Ubuntu 22.04:执行sudo apt install docker.io docker-compose,安装NVIDIA驱动与NVIDIA Container Toolkit,用nvidia-smi确认显卡可用后重启Docker。在deploy目录启动服务:
# Windows docker-compose up -d # Ubuntu docker-compose -f docker-compose-linux.yml up -dRTX 50系列显卡改用docker-compose -f docker-compose-5090.yml up -d;显存较小可用lite版docker-compose -f docker-compose-lite.yml up -d,lite版只启动视频生成一个服务。
等待约半小时完成镜像下载。duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个服务全部Running后服务端就绪,本地开放端口为8383(视频合成)、18180(语音合成)、10095(语音识别)。
安装客户端:Windows双击官方Release的
Duix.Avatar-x.x.x-setup.exe;Ubuntu双击.AppImage即可运行,root用户需在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox。
上手三步:从克隆形象到第一条视频
第一步:创建形象。客户端首页点击"Create Avatar"上传视频素材,训练完成后数字人出现在"My Avatars"列表中。
第二步:生成首条视频。点击"Create Video",选择目标数字人,输入要朗读的文案或上传音频文件,点击生成。系统先将文案合成为克隆音色,再驱动口型输出成片。
第三步:管理作品。生成的视频统一存放在"My Works",支持关键词搜索和分页浏览。右上角Setting菜单可打开客户端日志、切换界面语言。
卡住时先查这三处
| 现象 | 常见原因 | 处理方式 |
|---|---|---|
docker-compose up -d报连接超时 | Docker Hub官方源连接不稳定 | 在/etc/docker/daemon.json的registry-mirrors添加国内镜像源后重启Docker |
| 新增模特时报错 | 形象视频没有声音,或视频中没有人说话 | 更换带清晰人声的视频重新创建 |
| 定制模特报Connection refused | ASR服务启动慢,10095端口未就绪;16G内存机器资源不足 | 等服务全部Running后再等几分钟创建形象;16G内存仍失败则升级内存 |
查看详细日志时,在Docker Desktop打开对应容器的Logs页面即可。heygen-tts日志中出现"file not exists",通常是客户端与容器约定的音频路径不一致。
它适合谁,不适合谁
适合:需要批量产出口播视频且素材必须留在本地的内容生产场景;想把数字人接入既有系统的开发者——项目暴露本地HTTP接口,调用方式可直接参考 src/main/service/video.js 及同目录的 model.js、voice.js。
不适合:无NVIDIA显卡的机器,全部算力依赖GPU;月活超过1000的产品,需先取得商业授权;实时交互场景,本项目只处理"文案或音频到成片口播视频"的单向流程,不支持实时对话。
更多部署问题与自查步骤见 doc/常见问题.md。这套开源数字人方案的落地成本主要是磁盘空间和GPU性能,实际生成速度取决于本机显卡。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考