news 2026/9/11 17:17:52

Duix.Avatar开源数字人完整指南:10秒视频克隆形象,本地生成口播视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix.Avatar开源数字人完整指南:10秒视频克隆形象,本地生成口播视频

Duix.Avatar开源数字人完整指南:10秒视频克隆形象,本地生成口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款真正开源的 AI 数字人(digital human)工具包,可完全离线在本地运行,只需一段 10 秒视频即可克隆你的形象和声音,输入文字或音频就能生成口型匹配的播报视频。它适合个人创作者、自媒体和需要批量产出口播内容的团队,前提是手头有一台带英伟达显卡的电脑。

从一个具体场景说起

如果你一周要产出十几条口播视频,真人出镜、录音、剪辑会吃掉大量时间;把素材上传到在线服务,又涉及账号绑定和数据外流的风险。Duix.Avatar 的思路是:先拍一段 10 秒左右的正面视频,把它交给程序完成克隆;之后你只需要敲一段文案或丢一个音频文件,"数字版的你"就会开始播报。整个过程在你的本地电脑完成,素材不经过云端。

能力速览:它能帮你做什么

  • 形象与声音克隆|一段 10 秒视频完成数字人形象和声音克隆|想拥有一个可复用"数字分身"的人
  • 文字/语音驱动视频|输入文案自动生成口型匹配的播报视频|需要批量产出口播内容的自媒体、企业培训
  • 全离线运行|全程不依赖外网,素材不出本机|对数据隐私有要求的教育、企业内部场景
  • 多语言支持|脚本支持中、英、日、韩等 8 种语言|需要多语言内容的出海场景
  • 客户端 + API 双形态|桌面客户端小白友好,同时开放本地 HTTP API|既适合非技术用户,也适合要集成的开发者

上图是客户端主界面:左侧紫色区域是"Create Video"视频创建入口,下方"My Avatars"里列着你已训练好的数字人。

上手路线:三步拿到第一个成片

环境要求

先确认硬件是否达标。官方推荐配置为 i5-13400F / 32G 内存 / RTX 4070 级别,硬性要求有三点:

  • 英伟达显卡及对应驱动(本项目全部算力在本地,没有它服务起不来)
  • 内存建议 32G 及以上,16G 及以下可能无法启动
  • 磁盘空间:Windows 下 D 盘需大于 30G 空闲(存放模型和作品),Docker 镜像需要约 100G 空间(可换到其他磁盘)

系统方面支持 Windows 10(19042 及以上)和 Ubuntu 22.04 Desktop,其他 Linux 发行版的兼容情况详见官方文档。

安装部署

先克隆代码:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar

执行成功后你应该在当前目录看到新增的Duix-Avatar文件夹。

检查显卡驱动:

nvidia-smi

执行成功后终端会显示驱动版本和显卡信息;如果报错,先去安装或更新英伟达驱动。

然后安装 Docker。Windows 先执行wsl --installwsl --update,再安装 Docker Desktop;Ubuntu 用 apt 安装 docker.io 与 docker-compose 即可。

接着启动服务端,进入/deploy目录:

cd deploy && docker-compose up -d

执行成功后终端会提示 3 个容器依次 created、started;首次运行会拉取镜像,约 70G 流量、半小时左右,速度取决于网速。

docker ps

执行成功后你应该看到 asr、tts、gen-video 三个服务都处于 UP 状态,服务端即就绪。RTX 50 系列显卡换用 deploy/docker-compose-5090.yml,Ubuntu 用户用 deploy/docker-compose-linux.yml,lite 版只启动一个服务。

上图是 Docker Desktop 的资源设置页:如果系统盘剩余空间不足,可以点 Browse 把磁盘镜像位置迁到空间更大的磁盘。

最后安装客户端:从 release 页下载官方构建的安装包(Windows 为 exe,Ubuntu 为 AppImage),首次启动连接本地服务端即可。

第一次出结果

  1. 准备一段 10-30 秒的正面视频:背景简单、光线均匀,人全程在说话——程序要用这段声音做声音克隆。
  2. 在客户端"Create Avatar"上传,等待训练完成,耗时视显卡而定。
  3. 进入"Create Video",选择模型,输入文字或上传音频,点击生成。
  4. 合成完成后,在"My Works"里预览并下载你的口播视频。

高频问题:现象、原因与处理

拉镜像超时、连接失败。原因基本是 Docker Hub 连接不稳定。如果你遇到这种情况,先检查是否配置了国内镜像源:Windows 在 Docker Desktop 设置里加,Linux 改/etc/docker/daemon.json。具体示例见 doc/常见问题.md。

"定制模特"报 Connection refused。ASR 服务启动较慢,服务起来后等几分钟再开始克隆,多数情况会自行恢复;同时确认机器内存,16G 及以下可能直接起不来。

模特训练失败、声音克隆报错。先检查上传的视频里有没有你的人声。视频无声或人没在说话,训练必然失败,重拍一段即可。

三个服务始终起不来。先确认机器有英伟达显卡且驱动装好了,跑一次nvidia-smi看是否输出显卡信息。本项目算力全在本地,没有 GPU 基本无解。

客户端出了错找不到原因。用客户端右上角设置菜单里的"Open Log"拿客户端日志;服务端则到 Docker Desktop 点开对应容器的 Logs 查看。

上图展示了客户端设置菜单的位置:User Agreement、Open Log、Language switch 都从这里打开。

上图是 TTS 服务容器的日志界面:如果你遇到file not exists这类报错,先检查音频、视频对应的挂载路径是否真实存在。

上图是国内镜像源配置界面:加上几个可用的镜像源后,拉取超时问题通常就能解决。

进阶方向:给开发者的几个口子

这个项目不只是个现成工具,还有几处扩展点:

  • API 集成:Docker 启动后在本地暴露端口,127.0.0.1:18180负责模特训练与语音合成,:8383负责视频合成(提交与进度查询)。请求示例可以直接看 src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js。
  • 客户端定制:客户端基于 Electron + Vue3,页面组件在 src/renderer/src/views,多语言配置在 src/renderer/src/i18n,自己构建客户端需要 Node.js 18。
  • 服务端部署变体:deploy/ 下提供标准版、lite 版、50 系列显卡版和 Linux 版四份 compose 文件,按机器情况选用。

什么时候适合、什么时候别硬上

Duix.Avatar 的强项很明确:全本地离线、10 秒克隆、低成本批量产出口播视频,代码开源且支持商用(用户量超过 10 万或年营收超 1000 万美元的企业需签署商业许可协议)。边界同样清楚:它只支持带英伟达显卡的 Windows / Ubuntu 组合,没有 GPU 或磁盘空间不够就别硬上;口型效果属于"可用"级别,而非电影级精度。如果你追求更精致的成片或企业级 SLA 支持,建议先阅读官方文档了解其 API 服务方案再做选择。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 17:16:09

Fan Control 风扇控制实用指南:3 种使用场景把它调安静

Fan Control 风扇控制实用指南:3 种使用场景把它调安静 【免费下载链接】FanControl.Releases This is the release repository for Fan Control, a highly customizable fan controlling software for Windows. 项目地址: https://gitcode.com/GitHub_Trending/f…

作者头像 李华
网站建设 2026/9/11 17:15:23

Prompt 工程实战:开发者最常犯的 7 个错误与正确写法(附模板)

适用人群:日常用 AI(ChatGPT / Kimi / DeepSeek / Claude 等)辅助写代码、做方案、排查问题的开发者与技术从业者 前置条件:无,看完即用 本文收获:7 个高频 Prompt 错误 + 对应正确写法 + 一套可直接复制的 Prompt 模板(文末附录) 正文 作为一名软件工程师,我业余时…

作者头像 李华
网站建设 2026/9/11 17:12:31

数据中心碳核算指南:从能耗管理到碳中和实践

1. 绿色数据中心的时代背景与核心挑战 2023年全球数据中心耗电量已突破3000亿千瓦时,相当于德国全年用电总量。这个数字背后是数以百万计的服务器昼夜不停地运转,支撑着我们每天使用的各类互联网服务。随着AI大模型训练、4K视频流媒体、物联网设备爆发式…

作者头像 李华
网站建设 2026/9/11 17:07:32

Spring Boot+Vue招聘系统实战:数据模型、简历筛选与状态机设计

简介:一套基于Spring Boot的招聘信息管理系统毕业设计资源,面向Java初/中级学习者和毕设开发人群,覆盖职位发布、简历管理、应聘者筛选、面试安排等核心功能模块,既可作课题参考,也能为轻量级招聘平台提供可扩展的工程…

作者头像 李华
网站建设 2026/9/11 17:07:24

深耕ROS2实时性能优化:专注时间确定性提升之道

作为一名深耕机器人软件开发的从业者,我见证了ROS2从概念到实践的崛起。但它并非万能药;实时性挑战一直是悬在开发者头上的达摩克利斯之剑。在无数次项目实践中,我发现时间确定性恰恰是优化性能的核心杠杆。试想一个工业机械臂操作场景:若指令传递延迟毫秒之差,可能导致生…

作者头像 李华