news 2026/9/11 17:42:38

Duix.Avatar完全指南:4步本地克隆你的AI数字人,免费生成口播视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix.Avatar完全指南:4步本地克隆你的AI数字人,免费生成口播视频

Duix.Avatar完全指南:4步本地克隆你的AI数字人,免费生成口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar是一款完全开源、免费的AI数字人(数字分身)工具:上传一段10秒的视频,就能克隆你的形象和声音,输入文案即可自动生成口播视频。整个过程离线运行在你自己的电脑上:不联网、视频素材不上传第三方服务器、软件费用为0(用户量或营收达到一定规模的企业需签署商业许可协议,详见仓库根目录的LICENSE)。

🎬 它适合谁?先看看是不是你

  • 自媒体创作者:批量产出口播短视频,不同平台用不同形象,保持品牌一致
  • 企业市场/行政:快速制作产品介绍、内部培训视频,不用约拍摄和后期
  • 老师与培训师:统一课程讲师形象,课件一次制作反复使用
  • 开发者:本地部署后通过开放API接入自己的业务系统
  • 注重隐私的个人:视频和声音素材始终保存在本地硬盘,断网也能用

与商业数字人服务相比,这条路线的总成本是0:不付授权费、不按次收费,唯一的投入是你现有的电脑。

整套工具分两部分:服务端承担全部AI算力(面部识别、声音合成、口型渲染),客户端是纯图形化界面。不想碰代码的你,全程只需敲1条命令,其余都是鼠标点选。

🖥️ 环境准备与一键部署:核对4项配置,5步跑起来

配置要求一览表

项目要求说明
系统Windows 10(19042.1526及以上)/ Ubuntu 22.04其他Linux版本未做验证
显卡NVIDIA显卡(RTX 30/40/50系列)必须正确安装驱动,否则服务无法启动
内存建议32GB,最低16GB16GB可能无法启动ASR服务
硬盘Windows:C盘≥100G + D盘≥30G;Ubuntu:≥100GC盘存镜像,D盘存模型和作品

注意区分lite精简版和完整版:精简版只启动1个视频合成服务,镜像小、占盘少,适合低配机器;完整版启动3个服务,覆盖"克隆形象+声音合成+口型驱动"的完整流程。

Ubuntu装Docker本身很简单,2条命令搞定:

sudo apt update && sudo apt install -y docker.io docker-compose

装完用 docker --version 确认版本号,再配置NVIDIA Container Toolkit让Docker能调用显卡(装好后执行 nvidia-smi 能看到显卡信息即成功)。

5步部署步骤

  1. 更新WSL(Windows专属):未安装过先执行 wsl --install(网络原因失败就多试几次),然后执行 wsl --update
  2. 安装Docker Desktop:从Docker官网下载安装包,首次运行接受协议并跳过登录
  3. 获取项目代码:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar
  1. 一键启动服务(在deploy目录执行,下载镜像约70G、耗时约30分钟,建议连WiFi):
docker-compose up -d

Ubuntu用户改用 docker-compose -f docker-compose-linux.yml up -d;精简版则用 docker-compose -f docker-compose-lite.yml up -d 5. 安装客户端:从项目发布页下载官方安装包,Windows双击 Duix.Avatar-x.x.x-setup.exe 安装,Ubuntu双击 Duix.Avatar-x.x.x.AppImage 直接运行(若打不开,在终端加 --no-sandbox 参数执行)

成功的标志:Docker Desktop中出现3个服务(Duix.Avatar-asr、fish-speech、Duix.Avatar-gen-video),状态全部显示Running。

部署完成后,这3个服务在后台各管一段流程,了解它们的分工,排错时能立刻定位卡在哪一环:

  • Duix.Avatar-asr:转写你素材视频里的人说了什么,为声音克隆提供参考文本
  • fish-speech:学习你的音色,之后用你的声音朗读任意文案
  • Duix.Avatar-gen-video:让模型的口型对齐音频,渲染出最终视频

如果C盘空闲不足100G,可以在Docker Desktop的 Settings → Resources 里,点 Browse 把磁盘镜像的存放位置挪到空间更大的磁盘:

🎥 实战演练:4步做出你的第一个数字人口播视频

素材挑选要点(决定克隆效果)

  • 时长:10-20秒最合适,太短特征不够,太长处理变慢
  • 声音:视频中的人必须清晰说话,程序用这段声音克隆你的音色,无声视频会直接失败
  • 画面:正面角度、光线均匀,不用手和道具挡脸
  • 背景:纯色或简单背景,面部识别更稳定
  • 格式:MP4、MOV等常见格式都可以

操作4步

  1. 上传素材:首页点击 Create Avatar,选择准备好的视频,系统自动提取面部和声音特征,约3-5分钟
  2. 确认形象:训练完成后,My Avatars 列表里会出现你的模型缩略图,可以命名管理
  3. 写文案:选中模型,输入口播文本,支持中、英、日、韩、法、德、阿拉伯、西语8种语言
  4. 查看作品:生成完成后到 My Works 列表预览,口型与音频已自动对齐,可直接导出

点击生成后,后台其实走的是三段流水线:TTS服务先用你的克隆音色把文案读成音频,视频渲染服务再让模型口型逐帧对齐音频,最后合成输出。你在客户端看到的进度条,就是按这个顺序往前走的。

客户端首页就是工作区:上方是 Create Avatar(克隆形象)和 Create Video(生成视频)两个入口,下方是模型列表:

My Works 页面汇总你生成的所有口播视频;右上角 Settings 菜单里的 Open Log 可以随时打开客户端日志,排查问题用得上:

🩺 常见问题与排查:5个高频问题一次讲清

1. 启动服务时镜像下载超时

  • 现象:执行 docker-compose up -d 报 request canceled、context canceled 等错误。
  • 原因:Docker Hub官方镜像源连接不稳定。
  • 解决:打开Docker Desktop → Settings → Docker Engine,在JSON配置里加上 registry-mirrors 国内镜像源列表,点 Apply & restart 后重新执行启动命令。Ubuntu则在 /etc/docker/daemon.json 里加同样的配置并重启Docker服务。

2. 创建模特失败,提示视频不可用

  • 现象:上传视频、训练环节报错,模型生成不出来。
  • 原因:视频没有声音,或声音不是本人在说话。
  • 解决:重新录一段10-20秒、本人清晰说话的素材再上传。

3. 定制模特报 Connection refused

  • 现象:克隆形象时日志出现 Connection refused。
  • 原因:Duix.Avatar-asr服务启动较慢,还没就绪就被调用;内存只有16G的机器可能直接起不来。
  • 解决:等3个服务Running后再等2-3分钟开始克隆;仍失败就升级内存到32G。

4. 视频生成进度卡住,或fish-speech容器反复重启

  • 现象:进度停在某个百分比(比如20%)长时间不完成,或音频容器一直在重启。
  • 原因:音频合成服务内部报错,常见于文件路径或权限问题。
  • 解决:打开Docker Desktop,找到对应容器点 Logs 页查看具体报错;客户端侧也可通过 Settings → Open Log 查看日志,两边对照定位。

5. 服务起不来,或Ubuntu上双击客户端没反应

  • 现象:3个服务迟迟到不了Running;或Ubuntu上AppImage双击后无响应。
  • 原因:前者多半是显卡驱动没装好或磁盘空间不足,本项目全部算力依赖本地NVIDIA显卡;后者以root身份进桌面时,沙箱机制会阻止运行。
  • 解决:先执行 nvidia-smi 验证驱动,再检查磁盘剩余空间;Ubuntu改用终端执行 ./Duix.Avatar-x.x.x.AppImage --no-sandbox 启动。

提问前先做3项自查:① 3个服务是否全部Running;② 终端执行 nvidia-smi 能否正常显示显卡信息;③ 客户端和服务端是否都更新到最新版(服务端在deploy目录重跑一次 docker-compose up -d 即可)。

⚙️ 进阶与性能:API批量调用和提速优化

用开放API接入你的业务

Docker启动后,服务端会在本地 127.0.0.1 暴露接口,4个接口串起完整链路,参考实现可直接看对应源码:

环节接口作用参考文件
模特训练18180端口 /v1/preprocess_and_tran返回声音参考信息src/main/service/model.js
音频合成18180端口 /v1/invoke用克隆音色朗读文案src/main/service/voice.js
视频合成8383端口 /easy/submit提交音频和视频任务src/main/service/video.js
进度查询8383端口 /easy/query用任务编号轮询状态src/main/service/video.js

所有接口只监听本地回环地址,局域网内其他设备无法调用,这部分安全性天然有保障。

批量处理的思路很简单:把模型训练接口返回的参考信息存好,之后每条文案都按"音频合成 → 视频合成 → 轮询到完成 → 保存成品"的固定套路走。写个小脚本或挂个定时任务,就能让数字人夜间自动产出几十条口播视频。

硬件与速度参考

档位显卡内存速度参考
入门RTX 3060 12G16G每个视频几分钟
推荐RTX 4070 12G32G每个视频约1-2分钟
专业RTX 4090 24G64G每个视频1分钟内

显存只有8G的机器,建议先用lite版跑通完整流程,确认效果后再决定是否升级硬件。

让生成更顺手的3个习惯

  • 模型和作品放在SSD上,加载和写入速度明显更快
  • 保持NVIDIA驱动更新;50系列显卡可直接使用deploy目录里的 docker-compose-5090.yml 专属部署配置
  • 生成前关闭占用GPU的后台程序

关于容量:模型和作品都存在本地硬盘(Windows为D盘),30G足够放几十个模型;空间紧张时,删掉不用的模型即可立刻释放空间。

✅ 现在就开始

今天就能做的一件事:用手机录一段10秒的正面说话视频,部署完服务后拿它当第一个模特素材,半小时后你就能拥有第一段数字人口播视频。中途卡住时,优先查官方文档 doc/常见问题.md 和 deploy/ 目录,再到项目Issues列表搜索——社区每天在处理问题单,大概率已有现成答案。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 17:42:22

如何从 Avalonia 源码构建本地 NuGet 包并写入本机 NuGet 缓存?

如何从 Avalonia 源码构建本地 NuGet 包并写入本机 NuGet 缓存? 【免费下载链接】Avalonia Develop Desktop, Embedded, Mobile and WebAssembly apps with C# and XAML. The future of .NET UI 项目地址: https://gitcode.com/GitHub_Trending/ava/Avalonia …

作者头像 李华
网站建设 2026/9/11 17:40:34

用一句自然语言驱动浏览器:Midscene 完整指南

用一句自然语言驱动浏览器:Midscene 完整指南 【免费下载链接】midscene GUI Agent for E2E Testing 项目地址: https://gitcode.com/GitHub_Trending/mid/midscene 每天早上登录后台、核对页面数据、截图存档——这套动作你每天在做吗?Midscene …

作者头像 李华
网站建设 2026/9/11 17:40:33

C++与FPGA协同设计:原理、优化与实践

1. C与FPGA协同设计概述 在嵌入式系统和高性能计算领域,C与FPGA的协同设计已经成为一种强大的技术组合。这种设计模式充分利用了C在算法开发上的灵活性和FPGA在并行计算上的硬件优势,特别适合需要低延迟、高吞吐量的应用场景。 我最初接触这种设计方式是…

作者头像 李华
网站建设 2026/9/11 17:39:35

兰州市30米DEM数据处理与地形分析实战指南

简介:本资源为甘肃省兰州市30米分辨率数字高程模型(DEM)地理信息数据集,面向GIS初学者、城市规划与环境分析从业者及遥感教学实践者,解决地形建模、空间分析与区域可视化等基础应用需求。压缩包共12个文件,…

作者头像 李华
网站建设 2026/9/11 17:38:41

JAVA毕业设计-基于SpringBoot的甜点蛋糕商城系统的设计与实现 基于SpringBoot的烘焙销售服务系统(源码+LW+部署文档+全bao+远程调试+代码讲解等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

作者头像 李华