news 2026/9/11 4:19:46

三步完成 Duix.Avatar 本地部署:从零克隆你的数字人生成第一条口播视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
三步完成 Duix.Avatar 本地部署:从零克隆你的数字人生成第一条口播视频

三步完成 Duix.Avatar 本地部署:从零克隆你的数字人生成第一条口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

你有一段现成文案,想用自己的脸和声音做口播视频,但又不想每次对着镜头重拍。Duix.Avatar 是一款免费开源的数字人视频项目:提交一段 10 秒左右视频即可完成形象与声音克隆,输入文本或音频就能自动生成口型对齐的播报视频。全程基于 Docker 本地部署,跟着做完你就能产出第一条数字人视频。

一句话看懂:开源数字人视频工具能帮你做什么

Duix.Avatar 由服务端和客户端两部分组成:服务端是三个 Docker 容器,分别负责语音识别(ASR)、声音克隆合成(TTS)和视频合成;客户端是图形化桌面程序,负责上传素材和查看成片。所有算力都在你自己机器上离线完成,不联网也能跑。它最适合内容创作者、培训视频制作者,以及想通过 API 做二次集成的开发者。

能力对你的意义
10 秒视频克隆形象 + 声音不用 3D 建模、不用摄影棚,人人都能拥有数字分身
文本 / 音频驱动口型写完文案直接出片,支持中、英、日、韩等 8 种语言
全离线本地计算视频和声音数据不出内网,隐私自己可控
开源免费商用个人和小团队零授权成本,见 LICENSE

部署前检查:硬件与软件要求

先花两分钟核对配置,这是后面所有报错的源头。不满足最低配置时,容器会起不来或训练中途失败,装好也白装。

硬件要求:

项目最低配置推荐配置不满足的后果
显卡NVIDIA 显卡,显存 ≥8GBRTX 4070 及以上无 NVIDIA 显卡时三个容器全部无法启动
内存16GB32GB 及以上16GB 时 ASR 服务可能直接启动失败
磁盘100GB 空闲(存镜像)150GB 以上70GB 镜像下载到一半中断,前功尽弃
Windows 数据盘D 盘 ≥30GB(存数字人数据)50GB 以上训练素材和成片无处落盘

软件要求:

项目要求说明
系统Windows 10 19042.1526+ 或 Ubuntu 22.04 桌面版其他 Linux 版本官方未做兼容验证
DockerDocker Desktop(Windows)或 Docker Engine + compose(Linux)服务端完全靠容器运行
显卡驱动nvidia-smi能看到显卡信息Linux 还需额外安装 NVIDIA Container Toolkit

Windows 用户注意:Docker 镜像默认存在 C 盘。如果 C 盘不足 100GB,安装 Docker 后进入 Settings → Resources → Advanced,把 Disk image location 改到空间充足的磁盘再点 Apply & restart。

部署 🚀:三步完成 Duix.Avatar 本地部署

第一步:克隆源码

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

成功标志:目录里能看到deploy/(内含 4 个 compose 文件)和src/(客户端源码)。你不做客户端开发的话,真正要用到的只有deploy/目录。

第二步:启动服务端容器

cd deploy docker-compose up -d

这一步会拉取三个镜像,合计约 70GB,下载期间终端基本无输出,持续十几到三十分钟属正常现象,耐心等。RTX 5090 显卡改用docker-compose -f docker-compose-5090.yml up -d;Ubuntu 用-f docker-compose-linux.yml;只要口型驱动、不做克隆就用轻量版-f docker-compose-lite.yml up -d(只起视频合成一个服务)。

下载完成后,用这两条命令验证:

nvidia-smi docker ps --format "{{.Names}}: {{.Status}}"

成功标志:nvidia-smi能打出显卡信息(驱动没问题);docker ps输出三行且状态都是Upduix-avatar-tts(18180 端口)、duix-avatar-asr(10095 端口)、duix-avatar-gen-video(8383 端口)。看到这三个服务 Running,服务端就部署成功了。

第三步:安装并启动客户端

Windows 用户从项目发布页下载Duix.Avatar-x.x.x-setup.exe,双击按向导安装;Ubuntu 用户下载 Linux 版AppImage后执行:

chmod +x Duix.Avatar-x.x.x.AppImage ./Duix.Avatar-x.x.x.AppImage --no-sandbox

成功标志:客户端打开后看到 Home 主页,顶部是 "Create Video"(AI 视频生成)和 "Create Avatar"(创建数字人)两个入口,说明客户端已能连上本地服务端。

动手实践:产出你的第一条数字人视频

现在做一条完整任务线:先创建一个数字人,再用文本驱动生成第一条视频,最后用音频驱动生成第二条。全程只在客户端里点,不需要碰代码。

  1. 创建数字人:Home → 点 "Create Avatar" → 上传一段 10 秒左右的视频。要求:人脸居中清晰、光线均匀、全程有人说话(声音会被用来克隆音色)。提交后等待训练,视显卡不同约 1~3 分钟。成功后 "My Avatars" 列表出现新模型,缩略图取自你的视频。训练视频没有音轨会直接报错,这是新手最高频的坑。
  2. 文本驱动,生成第一条视频:Home → 点 "Create Video" → 选中刚建好的数字人 → 输入文案(支持 8 种语言)→ 确认音色与语速 → 开始生成。进度条走完需要几十秒到几分钟,取决于显卡和文案长度。完成后在 "My Works" 列表下载播放,重点听口型是否跟着语音走。

  1. 音频驱动,生成第二条视频:再次进入 "Create Video" → 这次改用音频上传入口,选一段你自己的录音(或从任意成品视频里抽出的音频)→ 提交。系统会按音频的节奏和语调对齐口型,产出的第二条视频用的就是你的原声,音色比文本驱动更自然。
  • 素材决定上限:10 秒左右、正脸、均匀光线、纯色背景、连续自然说话,克隆效果会明显更稳定;背景复杂或人脸过暗时,先换素材再怀疑软件。
  • 服务端刚启动完的几分钟内别急着训练:ASR 服务就绪偏慢,遇到Connection refused等几分钟重试即可,不是部署失败。
  • 想做批量或二次开发,直接读 src/main/service/ 下 model.js、video.js、voice.js,就是模型训练、音频合成、视频合成的完整调用流程。

进阶:素材质量、GPU 加速与 API 集成

素材要点:训练视频记住四个字——清晰、稳定;音频记住两个词——安静、自然。10 秒足够,但别为了凑时长录进停顿和杂音。

GPU 与存储:三个容器都声明了runtime: nvidia,部署前先跑nvidia-smi确认显卡可用,否则容器起不来。RTX 5090(以及 30/40 系 CUDA 12.8 环境)走deploy/docker-compose-5090.yml。生成速度主要受显存限制,8GB 显存可跑,12GB 以上更从容。

API 集成:服务端起来后会在本机暴露三个端口,最常用的是 8383 的视频合成。最短的一次提交 + 一次查询:

curl -X POST http://127.0.0.1:8383/easy/submit -H "Content-Type: application/json" \ -d '{"audio_url":"D:/duix_avatar_data/face2face/audio.wav","video_url":"D:/duix_avatar_data/face2face/video.mp4","code":"task-001","chaofen":0,"watermark_switch":0,"pn":1}' curl "http://127.0.0.1:8383/easy/query?code=task-001"

code是你自定义的任务唯一标识,提交后用同一个 code 轮询进度直到完成。声音克隆合成(18180 端口/v1/invoke)和模特训练接口的完整参数,参考 src/main/service/voice.js 与 src/main/service/model.js,无需自己拼协议。

常见问题:数字人视频生成避坑清单

现象原因解决与关键排查命令
docker-compose up -d十几秒即超时,报context canceledDocker Hub 官方源连接不稳定,镜像拉不下来在 Docker 设置中配置 registry-mirrors 镜像源(见下图)后重试,再用docker images确认三个镜像齐全
服务起不来或反复重启NVIDIA 驱动未装或未生效,容器拿不到 GPU装好驱动,nvidia-smi能显示显卡信息后再docker-compose up -d
定制模特训练报Connection refusedASR 服务启动慢,调用时还没就绪服务端启动后等 5 分钟再重试,先docker ps确认三个服务均 Running
新增模特报错,提示视频必须有声音上传的训练视频无音轨或无人说话重录 10 秒左右有人连续说话的视频,可用ffmpeg -i 视频.mp4确认存在音频流
客户端显示无法连接本地服务服务未全部 Running,或 18180/10095/8383 端口被占用docker ps看状态,docker logs duix-avatar-gen-video看日志定位(见下图)

三个容器都 Running 之后,你的 Duix.Avatar 本地部署就真正完成了:后续每次产出数字人视频只是在客户端里点几下,数据全程不出内网。遇到问题先查 doc/常见问题.md 这份官方排错清单,容器参数和硬件适配方案看 deploy/ 下的四个 compose 文件,版本更新与社区动态以 README_zh.md 为准。现在就打开终端跑一遍nvidia-smi,把第一个 70GB 的镜像拉下来吧。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 4:18:43

ESP32双屏GIF播放:从崩坏到稳定8小时的完整优化指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 4:18:27

AI Agent用户记忆系统:跨会话持久化实战指南

1. 这不是“记住密码”,而是让AI真正认出你——从会话级记忆到人格化交互的底层跃迁你有没有试过和某个AI助手聊了半小时,它帮你梳理了项目计划、查了三份竞品资料、还顺手生成了会议纪要,结果你第二天打开对话框,它却一脸茫然&am…

作者头像 李华
网站建设 2026/9/11 4:17:02

基于OpenCV与Dlib的人脸识别门禁系统毕设实战指南

简介:一套基于OpenCV与Dlib的人脸识别门禁系统完整源码,主要面向计算机相关专业毕业生及需要完成课程设计、期末大作业的高校学生。源码已经本地编译验证可运行,项目评审分数达到98分,难度适中,适合作为毕业设计或综合…

作者头像 李华
网站建设 2026/9/11 4:15:52

技能提升的科学方法:刻意练习与神经科学原理

1. 项目概述"Skill 制作的黄金法则与实用技巧"这个标题直指技能培养与提升的核心方法论。作为一名长期从事技能培训的实践者,我深知掌握正确的技能习得方法比盲目练习重要百倍。本文将分享我多年来总结的实用框架和真实案例,这些经验帮助过数百…

作者头像 李华
网站建设 2026/9/11 4:14:31

数据库演进、AI基础设施与异步编程:2026技术趋势与实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华