news 2026/9/11 2:47:41

Duix.Avatar 完整指南:离线克隆数字人形象与声音,零成本生成口播视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix.Avatar 完整指南:离线克隆数字人形象与声音,零成本生成口播视频

Duix.Avatar 完整指南:离线克隆数字人形象与声音,零成本生成口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

录一条 1 分钟的口播视频,要化妆、布光、录音、剪辑半天?Duix.Avatar 是一个完全开源、可离线运行的 AI 数字人工具箱,用一段真人视频就能克隆你的形象和声音,之后只需输入文字就能产出说话视频,全程不联网,三个服务跑在一块 NVIDIA 显卡上即可。

一分钟读懂:Duix.Avatar 能做什么

它解决的是一件事:把你的形象和声音变成一台 7x24 小时在线的"数字分身",你用文字或语音驱动它说话,它自动生成口型对齐的视频。

适合谁:

  • 内容创作者:不想反复出镜,用文字批量产出口播视频;
  • 企业团队:需要内部培训、课程录制,数据不能上云;
  • 开发者:想拿一套开源 API 做自己的数字人产品。

关键数据:官方把数字人制作成本从传统 3D 方案的高额投入压到约 1000 美元级别,并已支撑 1 万+ 企业、50 万个个性化形象;脚本支持中、英、日、韩、法、德、阿、西 8 种语言。

核心机制拆解:一段视频如何变成你的数字人

整个仓库是"桌面客户端 + 三个本地 AI 服务"的结构,代码入口在 src/main/。

声音克隆:让 TTS 服务"学会"你的嗓音

打个比方:就像给配音演员做嗓音采样。你上传的视频里有人声,客户端先用 ffmpeg 把音轨抽出来(见 src/main/util/ffmpeg.js),再通过127.0.0.1:18180/v1/invoke交给 fish-speech 语音克隆服务,生成一个专属说话人。之后任何文字,都能用"你的声音"念出来。相关调用封装在 src/main/service/voice.js 和 src/main/api/tts.js。

形象克隆:从一条视频拆出"脸 + 声"

打个比方:像把一枚硬币扫成 3D 存档。你在客户端新建 Avatar 时,src/main/service/model.js 会先把原视频统一转成 H.264,再用 ffmpeg 分离出无声视频和 wav 音频,前者交给 face2face 视频服务做人脸建模,后者走上一条的语音克隆流程,最后把两条产物的 ID 一起写进本地 SQLite 数据库(src/main/dao/)。

视频合成:文字怎么变成口型对齐的视频

打个比方:文字先变成"你的声音",声音再驱动"你的脸"张嘴。src/main/service/video.js 负责编排整个流水线:文字 → 本地 TTS 生成音频 → 调127.0.0.1:8383/easy/submit提交视频合成任务 → 轮询进度直到完成。任务状态存在本地数据库,即使中途重启,src/main/interval/interval.js 的定时轮询也会把没跑完的任务续上。

横向对比:本地部署 vs 在线 API 数字人

维度在线 API 数字人Duix.Avatar 本地部署
网络依赖必须联网,数据出内网完全离线,素材不离开本机
硬件要求无,买算力即可需 NVIDIA 显卡,推荐 RTX 4070 / 32G 内存
定制化只能用对方接口,改不了算法源码全开放,可改模型、换 TTS、扩展 API
成本结构按调用量付费,长期成本高一次部署长期使用,零调用费用
商业授权随服务付费支持全球免费商用(超大规模企业需签商业授权)

结论很直接:数据敏感或长期高频使用,本地部署的总成本优势明显;只是临时尝鲜,在线 API 更快。

从 0 到 1:5 步生成第一条数字人视频

以 Windows 为例,Ubuntu 22.04 流程类似,配置见 deploy/ 目录下的多个 docker-compose 文件。

  1. 装好 Node.js 18 和 Docker Desktop(WSL2),确认nvidia-smi能显示显卡信息;
  2. 拉取三个镜像:guiji2025/fun-asrguiji2025/fish-speech-zimingguiji2025/duix.avatar
  3. 进入deploy目录执行docker-compose up -d,首次下载约 70GB 流量,耐心等待约半小时;
  4. 看到 3 个服务全部 Running 即部署成功,安装 Electron 桌面客户端并登录本机服务;
  5. 上传 1 段正面真人视频"新建 Avatar"训练形象与声音,再进"Create Video"输入文字,等待合成即可导出视频。

想自己改代码跑客户端,先克隆仓库:git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar,然后npm install && npm run dev

本地部署的 5 个常见坑与正确做法

  1. **误区:没有 NVIDIA 显卡也硬装,服务起不来。**|正确做法:三个服务全部依赖 GPU 计算,部署前先跑nvidia-smi确认驱动正常,这是官方 FAQ 的第一自检项。
  2. **误区:把服务跑在 C 盘,空间不足。**|正确做法:Windows 下 D 盘预留 30GB+ 存数字人数据、C 盘预留 100GB+ 存镜像;Docker 数据目录可手动改到其他盘。
  3. **误区:客户端报错就重装。**|正确做法:先按 doc/常见问题.md 的模板取日志——客户端日志在设置面板可导出,服务端日志看对应容器的 Logs 页,再对照 Issues 提问。

  1. **误区:客户端和服务器版本不一致。**|正确做法:项目更新频繁,遇到先升再查——服务端在deploy目录重跑docker-compose up -d,客户端拉最新代码重新 build。
  2. **误区:50 系显卡直接用旧版 compose 文件。**|正确做法:5090 等 50 系 GPU 要用官方 PyTorch 预览版方案,对应deploy/docker-compose-5090.yml,30/40 系搭配 CUDA 12.8 也可用。

谁适合用,接下来会发生什么

适合有两类人:要"零成本批量产出口播视频"的创作者,以及"素材不能上云、要掌控全链路"的技术团队。

接下来可以关注三件事:客户端已支持 Ubuntu 22.04 桌面版并加入英文界面,跨平台覆盖在扩大;50 系显卡适配已完成,硬件门槛继续下探;模型训练与视频合成均已暴露本地 HTTP API(127.0.0.1:8383/:18180),方便把它嵌进自己的业务系统。

Duix.Avatar 把数字人克隆从"买服务"变成"装软件":开源、离线、全链路可控。装好它,你的第一条口播视频只需要一段文字。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 2:46:58

Goldie 编码 Agent:自动搞定 App Store 截图、预览视频与合规校验

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 2:46:22

算法市场怎么做?AI应用架构师驱动企业AI落地的5个关键步骤

这两年走访了不少正在做数字化改造的传统企业,发现一个高频现象:底座搭得很豪华,湖仓一体、数据中台、AI中台一个不少,可真正到了“算法”这一层,项目就开始失速。业务部门说算法团队不接地气,算法团队说业…

作者头像 李华
网站建设 2026/9/11 2:39:11

串口协议设计六要点:从联调暴毙到稳定通信

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华