Duix.Avatar开源数字人完整指南:10秒视频克隆形象,本地生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款真正开源的 AI 数字人(digital human)工具包,可完全离线在本地运行,只需一段 10 秒视频即可克隆你的形象和声音,输入文字或音频就能生成口型匹配的播报视频。它适合个人创作者、自媒体和需要批量产出口播内容的团队,前提是手头有一台带英伟达显卡的电脑。
从一个具体场景说起
如果你一周要产出十几条口播视频,真人出镜、录音、剪辑会吃掉大量时间;把素材上传到在线服务,又涉及账号绑定和数据外流的风险。Duix.Avatar 的思路是:先拍一段 10 秒左右的正面视频,把它交给程序完成克隆;之后你只需要敲一段文案或丢一个音频文件,"数字版的你"就会开始播报。整个过程在你的本地电脑完成,素材不经过云端。
能力速览:它能帮你做什么
- 形象与声音克隆|一段 10 秒视频完成数字人形象和声音克隆|想拥有一个可复用"数字分身"的人
- 文字/语音驱动视频|输入文案自动生成口型匹配的播报视频|需要批量产出口播内容的自媒体、企业培训
- 全离线运行|全程不依赖外网,素材不出本机|对数据隐私有要求的教育、企业内部场景
- 多语言支持|脚本支持中、英、日、韩等 8 种语言|需要多语言内容的出海场景
- 客户端 + API 双形态|桌面客户端小白友好,同时开放本地 HTTP API|既适合非技术用户,也适合要集成的开发者
上图是客户端主界面:左侧紫色区域是"Create Video"视频创建入口,下方"My Avatars"里列着你已训练好的数字人。
上手路线:三步拿到第一个成片
环境要求
先确认硬件是否达标。官方推荐配置为 i5-13400F / 32G 内存 / RTX 4070 级别,硬性要求有三点:
- 英伟达显卡及对应驱动(本项目全部算力在本地,没有它服务起不来)
- 内存建议 32G 及以上,16G 及以下可能无法启动
- 磁盘空间:Windows 下 D 盘需大于 30G 空闲(存放模型和作品),Docker 镜像需要约 100G 空间(可换到其他磁盘)
系统方面支持 Windows 10(19042 及以上)和 Ubuntu 22.04 Desktop,其他 Linux 发行版的兼容情况详见官方文档。
安装部署
先克隆代码:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar执行成功后你应该在当前目录看到新增的Duix-Avatar文件夹。
检查显卡驱动:
nvidia-smi执行成功后终端会显示驱动版本和显卡信息;如果报错,先去安装或更新英伟达驱动。
然后安装 Docker。Windows 先执行wsl --install并wsl --update,再安装 Docker Desktop;Ubuntu 用 apt 安装 docker.io 与 docker-compose 即可。
接着启动服务端,进入/deploy目录:
cd deploy && docker-compose up -d执行成功后终端会提示 3 个容器依次 created、started;首次运行会拉取镜像,约 70G 流量、半小时左右,速度取决于网速。
docker ps执行成功后你应该看到 asr、tts、gen-video 三个服务都处于 UP 状态,服务端即就绪。RTX 50 系列显卡换用 deploy/docker-compose-5090.yml,Ubuntu 用户用 deploy/docker-compose-linux.yml,lite 版只启动一个服务。
上图是 Docker Desktop 的资源设置页:如果系统盘剩余空间不足,可以点 Browse 把磁盘镜像位置迁到空间更大的磁盘。
最后安装客户端:从 release 页下载官方构建的安装包(Windows 为 exe,Ubuntu 为 AppImage),首次启动连接本地服务端即可。
第一次出结果
- 准备一段 10-30 秒的正面视频:背景简单、光线均匀,人全程在说话——程序要用这段声音做声音克隆。
- 在客户端"Create Avatar"上传,等待训练完成,耗时视显卡而定。
- 进入"Create Video",选择模型,输入文字或上传音频,点击生成。
- 合成完成后,在"My Works"里预览并下载你的口播视频。
高频问题:现象、原因与处理
拉镜像超时、连接失败。原因基本是 Docker Hub 连接不稳定。如果你遇到这种情况,先检查是否配置了国内镜像源:Windows 在 Docker Desktop 设置里加,Linux 改/etc/docker/daemon.json。具体示例见 doc/常见问题.md。
"定制模特"报 Connection refused。ASR 服务启动较慢,服务起来后等几分钟再开始克隆,多数情况会自行恢复;同时确认机器内存,16G 及以下可能直接起不来。
模特训练失败、声音克隆报错。先检查上传的视频里有没有你的人声。视频无声或人没在说话,训练必然失败,重拍一段即可。
三个服务始终起不来。先确认机器有英伟达显卡且驱动装好了,跑一次nvidia-smi看是否输出显卡信息。本项目算力全在本地,没有 GPU 基本无解。
客户端出了错找不到原因。用客户端右上角设置菜单里的"Open Log"拿客户端日志;服务端则到 Docker Desktop 点开对应容器的 Logs 查看。
上图展示了客户端设置菜单的位置:User Agreement、Open Log、Language switch 都从这里打开。
上图是 TTS 服务容器的日志界面:如果你遇到file not exists这类报错,先检查音频、视频对应的挂载路径是否真实存在。
上图是国内镜像源配置界面:加上几个可用的镜像源后,拉取超时问题通常就能解决。
进阶方向:给开发者的几个口子
这个项目不只是个现成工具,还有几处扩展点:
- API 集成:Docker 启动后在本地暴露端口,
127.0.0.1:18180负责模特训练与语音合成,:8383负责视频合成(提交与进度查询)。请求示例可以直接看 src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js。 - 客户端定制:客户端基于 Electron + Vue3,页面组件在 src/renderer/src/views,多语言配置在 src/renderer/src/i18n,自己构建客户端需要 Node.js 18。
- 服务端部署变体:deploy/ 下提供标准版、lite 版、50 系列显卡版和 Linux 版四份 compose 文件,按机器情况选用。
什么时候适合、什么时候别硬上
Duix.Avatar 的强项很明确:全本地离线、10 秒克隆、低成本批量产出口播视频,代码开源且支持商用(用户量超过 10 万或年营收超 1000 万美元的企业需签署商业许可协议)。边界同样清楚:它只支持带英伟达显卡的 Windows / Ubuntu 组合,没有 GPU 或磁盘空间不够就别硬上;口型效果属于"可用"级别,而非电影级精度。如果你追求更精致的成片或企业级 SLA 支持,建议先阅读官方文档了解其 API 服务方案再做选择。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考