Duix.Avatar本地数字人视频生成完全指南:一段10秒视频克隆自己,免费生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款真·开源的本地数字人项目。你只需提供一段 10 秒左右、自己出镜说话的视频,就能完成形象和声音的双克隆;之后输入文案,它会自动生成口型对得上的口播视频。全程在你的电脑上离线运行,素材不会上传到任何云端。如果你需要做产品口播、课程录课或个人短视频,又不想为付费数字人服务掏钱,这篇指南带你从零跑到第一个成片。
它到底能帮你解决什么
先说清楚它值不值得你花时间装:下面三个场景,有一个对上号就值得动手。
把"出镜"这件事一劳永逸拍口播视频最贵的是人:打光、布景、重录、后期。用 Duix.Avatar 克隆一次自己的形象和声音后,数字人模型会一直存在"我的形象"列表里,以后写什么文案就说什么文案,不再需要真人站在镜头前。
批量产出数字人口播视频同一形象可以反复使用。今天生成产品介绍,明天生成课程讲解,后天生成节日问候——画面人物始终是你,只有文案在变,内容产出的边际成本接近于零。
素材和数据留在本机从视频分离、声音克隆到音视频合成,整条链路都在本地 GPU 上完成。对不能把人脸、声音素材交给云服务的团队和个人来说,这是选择本地部署而不是在线 SaaS 的关键理由。
动手前的准备
这一段核对硬件配置、装好依赖并拉起服务端,是后面一切的地基。
机器要求(硬性)
- 一块英伟达显卡,且已正确安装显卡驱动——全部算力在本地 GPU 上,没有它服务起不来
- 内存 32G 及以上;参考配置:i5-13400F + RTX 4070
- 磁盘:Windows 下需要 D 盘存放数字人和作品(空闲 30G 以上),Docker 镜像默认写在 C 盘(空闲 100G 以上,首次启动要下载约 70G 镜像)
- 系统:Windows 10 19042.1526 及以上,或 Ubuntu 22.04
装软件
- Windows 先在终端执行
wsl --install装好 WSL,再安装 Docker Desktop 并首次启动(接受协议、跳过登录即可) - 安装最新的英伟达显卡驱动,装完执行
nvidia-smi,能显示出显卡信息就算成功 - 如果打算从源码构建客户端,另外装 Node.js 18;直接用官方打包好的客户端则不需要
获取项目并启动服务端
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar克隆完成后,进入项目的 deploy/ 目录,执行下面这条命令启动服务端:
cd deploy docker-compose up -d首次拉取镜像约需半小时,建议连 WiFi。在 Docker 里看到 asr、tts、gen-video 三个服务都变为 Running,服务端就就绪了。显存紧张可以改用轻量版(只启动视频合成一个服务),在命令里加-f docker-compose-lite.yml;Ubuntu 用户则用docker-compose-linux.yml。
C 盘空间不够的话,不要硬装:打开 Docker Desktop 的设置 → Resources,把磁盘镜像位置改到剩余空间 100G 以上的磁盘。
客户端从项目 Releases 获取官方安装包:Windows 是 .exe 安装程序,Ubuntu 是 AppImage,双击即可启动。
第一次跑通
目标只有一个:四步生成第一条数字人视频。先看到成片,再回头研究细节。
- 打开客户端,点Create Avatar(创建形象),上传一段 10 秒左右的说话视频
- 注意两个硬性条件:视频必须有声音,且必须是本人在说话——程序要用这段声音做声音克隆
- 等模型生成完毕,"我的形象"里会出现你的数字人
- 点Create Video(创建视频),选中刚建好的形象,输入一段文案,点击生成
成片会出现在"我的作品"里,可以直接预览和保存。到这里,最小闭环已经跑通。
核心能力拆解
下面三个能力就是这个项目值钱的地方,逐个讲清它是什么、怎么用、适合谁。
声音与形象双克隆
你上传的说话视频会被拆成两路处理:一路分离出纯语音,送入语音服务(基于 fish-speech 模型)完成声音克隆,同时用语音识别(基于 fun-asr)把视频里的话转成文字作为参考;另一路无声视频用于构建形象模型。两条结果都会留存,供后续合成时反复调用。适合想拥有一个可长期复用的"数字分身"的人——克隆一次,无限次使用。
文字与语音驱动视频生成
克隆完成后,生成视频有两种入口:输入文字,系统先用你的克隆音色合成语音,再由视频服务驱动数字人做口型并合成音视频;或者直接上传现成的音频文件,跳过文字转语音这一步,让它按音频的节奏驱动口型。脚本支持中、英、日、韩、法、德、阿拉伯语、西班牙语共 8 种语言。适合做系列口播、多语言内容搬运和日常播报视频。
开放 API,接入你自己的系统
服务端启动后会在本机暴露端口:声音克隆与语音合成走 18180 端口,视频合成任务提交和进度查询走 8383 端口。想集成进自己的产品?调用代码就在客户端源码 src/main/service/ 里,照着写就行。适合需要把数字人能力嵌进自有业务系统的开发者。
让效果更好的调优清单
- 克隆素材:光线均匀、正面出镜、无遮挡、人声清晰稳定;宁可重录 10 秒干净的,也别用带环境音的长视频
- 长文案:分段生成再拼接,别一次塞超长文本排队
- 50 系列显卡:在 deploy/ 目录改用
docker-compose -f docker-compose-5090.yml up -d(30/40 系列配 CUDA 12.8 也可用这套) - 磁盘:镜像下载约 70G,C 盘不够就按前文改 Docker 磁盘位置,不要边下边清理
- 保持更新:项目更新频繁,不少问题新版已修;服务端到 deploy 目录重新执行
docker-compose up -d,客户端拉取代码后重新构建
卡住了怎么办
按"问题—原因—解法"速查这四条,更多细节看 常见问题文档。
问题一:docker-compose up -d报连接 registry-1.docker.io 超时原因:Docker Hub 官方源连接不稳定。 解法:开全局代理,或在 Docker 的 daemon.json 里给registry-mirrors配置国内镜像源,保存、重启 Docker 后重新执行命令。
问题二:新增模特(克隆形象)时直接报错失败原因:上传的视频没有声音,或画面里没有人说话,声音克隆无料可用。 解法:重录一段 10 秒左右、人声清晰的说话视频再上传。
问题三:三个 Docker 服务起不来或反复重启原因:缺英伟达显卡,或驱动没装好,本地 GPU 算力无法挂载。 解法:执行nvidia-smi确认能显示显卡信息,安装或更新驱动后重启服务。
问题四:报错信息看不明白,定位不到原因解法:两端都看日志。客户端点右上角设置里的"Open Log"查看本地日志;Docker 中点进对应服务,打开日志面板,把关键几行复制出来对照排查。
你的本地数字人工作台已经搭好。先去生成一条口播视频,感受一下嘴型与声音的效果,再尝试 8 种语言脚本和开放 API,让它慢慢变成你的内容生产线。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考