10秒视频克隆你的数字分身:Duix.Avatar 开源AI数字人本地部署实操
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
拍一条口播视频,人得全程守在镜头前,错一句就得重录一遍,这是很多小团队的日常。网上那些云端数字人服务,要么先上传视频、按次收费,要么素材必须出机器,心里不踏实。Duix.Avatar 是一个开源的 AI 数字人工具包:提交一段 10 秒左右的视频,它就能克隆你的形象和声音,之后输入文案或音频就能驱动数字人开口,自动生成口型同步的口播视频,而且本地部署全程离线,素材不用出机器。
一句话认识 Duix.Avatar
它是「数字人克隆 + 口播视频生成」的开源项目,支持本地部署和 API 调用两种用法。解决的很直接:不想出镜、不想把素材交给云端、也不想按条付费的时候,在自己电脑上就能批量产出数字人口播视频。适合两类人——想离线做视频内容的普通用户,以及想基于它二次开发的开发者(界面支持中英文,脚本文案支持中、英、日、韩、法、德、阿、西 8 种语言)。
从零跑起来:硬件核对与三步部署
先核对这张硬件要求表
| 项目 | Windows | Ubuntu |
|---|---|---|
| 系统 | Windows 10 19042.1526 及以上 | Ubuntu 22.04 Desktop(内核 6.8.0-52) |
| 显卡 | 英伟达显卡 + 最新驱动(推荐 RTX 4070 级别,50 系列有专用方案) | 同左 |
| 内存 | 32G 及以上 | 32G 及以上 |
| 磁盘 | C 盘 100G+(存镜像)、D 盘 30G+(存模型和作品) | 100G+ 空闲空间 |
Windows 下 C 盘不足 100G 也没关系,装完 Docker 后可以在设置里把镜像存储位置换到别的盘:
分步完成安装
- 克隆仓库:拿到全部代码和部署脚本。
- 装好 Docker:Windows 先执行
wsl --list --verbose查看是否装过 WSL(没装就wsl --install),再wsl --update更新,最后安装 Docker Desktop 并启动;Ubuntu 直接sudo apt install docker.io docker-compose,并按官方文档装好显卡驱动和 NVIDIA Container Toolkit。 - 启动服务端:进到仓库的
deploy目录,执行:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d首次拉镜像大约消耗 70G 流量,耐心等半小时左右。只想跑视频合成一个服务的话,改用docker-compose -f docker-compose-lite.yml up -d;50 系列显卡用docker-compose-5090.yml,Ubuntu 用docker-compose-linux.yml。 4.装客户端:从项目 Release 页面下载官方构建,Windows 双击Duix.Avatar-x.x.x-setup.exe安装;Ubuntu 双击 AppImage 即可运行(root 桌面下需加--no-sandbox参数)。
确认服务已正常启动
打开 Docker 的容器列表(或执行docker ps),看到duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video三个服务的状态都是 Running,就算部署成功了(lite 版本只需看duix-avatar-gen-video一个)。点进任意容器还能直接看启动日志:
完成一次真实任务:做出第一条口播视频
客户端打开就是主界面,顶部两大入口很直白:Create Video(输入文案让数字人开口说话)和Create Avatar(上传视频生成你自己的数字人);下面就是My Works(已生成的视频作品)和My Avatars(已创建的数字人模型)两个列表:
完整走一遍流程:
- 点Create Avatar,上传一段 10 秒左右、人物说话清晰的视频。系统会自动把视频拆成无声画面 + 人声音频,分别做形象和声音克隆,完成后你的数字人就出现在 My Avatars 里。
- 点Create Video,选中刚克隆的模型,右侧输入一段文案(也可以直接上传一段现成音频)。
- 提交后等合成完成,页面上直接给出成片预览,视频自动归档到 My Works,可以下载。
成片里数字人的口型会和声音逐句对齐,听感上就是"视频里那个人"在念你写的稿子。
还能玩出什么花样
- 一稿多语:同一份文案要出多个语言版本,不用找翻译重录——文案支持 8 种语言,让同一个数字人分头念出不同语言的版本。
- 纯离线环境:展会现场、内网机房这种网络不通或不稳的场合,服务完全跑在本地,生成视频不联网,素材也不离开机器。
- 多个"主持人"同用:客户端支持导入并管理多个模型,准备几个不同形象,在 My Avatars 里一键切换、按角色生成,不用每次重克隆。
想再深入一点:这些入口值得收藏
- 四种启动脚本(完整版 / 轻量版 / 5090 显卡版 / Linux 版):deploy/
- 服务端口(TTS 18180、视频合成 8383、ASR 10095)与本地数据目录的配置:src/main/config/config.js
- 模型训练、音频合成、视频合成三个环节的 API 调用示例代码:src/main/service/,Docker 起来后这些端口在
127.0.0.1上可直接调用 - 界面源码(
video-edit目录就是视频生成页):src/renderer/src/views/ - 客户端排查问题先看日志:右上角 Setting 菜单里可以打开客户端日志、看用户协议、切换中英文:
- 更完整的问答汇总:doc/常见问题.md
常见坑:三处最容易卡住
- 拉镜像失败:
docker-compose up -d时三个服务接连报request canceled/context canceled——Docker Hub 官方源不稳定,在 Docker 的 Docker Engine 配置里加国内镜像源(registry-mirrors)或用全局代理,然后重新拉。 - 克隆形象报 "file not exists":容器日志里反复刷这个错,先检查文件路径是否含中文或特殊字符、文件是否真的放在 docker-compose 挂载的目录里;如果是 ASR 服务 Connection refused,那是识别服务启动慢,等三个服务全部 Running 后几分钟再操作,内存只有 16G 的机器可能根本拉不起来:
- 新增模特报错:用来创建模特的视频里必须有人在说话,因为程序要靠这段声音做声音克隆,纯无声或纯画面视频必然失败。
部署本身不复杂,真正要预留的是磁盘空间和那半小时的下载时间。跑通之后你会得到一个可离线反复使用的"数字分身",从口播到批量出片都顺手。第一步就去做最核心的一件事:录一段 10 秒自己说话的视频,用 Create Avatar 克隆出第一个数字人,再让它念出一段你随手写的文案。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考