news 2026/9/11 4:10:28

10秒视频做出数字分身:用 Duix.Avatar 本地部署 AI 数字人的完整上手指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
10秒视频做出数字分身:用 Duix.Avatar 本地部署 AI 数字人的完整上手指南

10秒视频做出数字分身:用 Duix.Avatar 本地部署 AI 数字人的完整上手指南

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款免费开源的AI 数字人工具,支持本地部署:上传一段 10 秒左右的真人视频,它就能同时克隆你的形象和声音,之后输入一段文字或上传一段音频,即可自动生成口型匹配的播报视频。全程在自家电脑离线跑完,适合想做口播内容的创作者,也适合想在自己机器上玩数字人克隆、又不想把素材交给云端的人。

它能帮你做成什么事:能力清单 + 路线对比

先说清楚它到底能干哪些活,再决定值不值得折腾:

  • 一段视频出两个分身:上传 10 秒说话视频,系统自动分离画面和声音,形象克隆、声音克隆一次完成,不用分别训练
  • 文字直接变视频:写好文案点生成,系统自动配音并把口型对齐,产出成品口播视频
  • 音频直接驱动:不用写文案,上传自己录好的音频(甚至配音员的干声),数字人照着说
  • 一个模特反复用:形象建好后存在本地,可以反复生成多个作品,也支持同时维护多个模特
  • 多语言文案:脚本支持中、英、日、韩、法、德、阿拉伯语、西语 8 种语言
  • 全离线运行:所有算力都在本地,脚本、人脸、声音都不出你的机器
  • 开放 API:模特训练、音频合成、视频合成的接口都对127.0.0.1开放,可以直接接进你自己的系统,调用示例见 src/main/service/

那该走哪条路线?看你的身份:

你的情况建议路线
有英伟达显卡、爱折腾、要改代码深度定制本地部署 Duix.Avatar 开源版(本文路线)
不想买 GPU、专注业务集成、要稳定商用保障官方数字人/克隆音 API 接口服务

本文只讲本地部署这条线。硬件门槛先亮出来:必须有英伟达显卡和驱动,推荐 i5-13400F + 32G 内存 + RTX 4070,内存低于 32G 大概率起不来。

裸机走通:从装环境到第一条数字人视频

这条链路走下来大约一两个小时,大部分时间在等镜像下载,你真正动手的只有十几次点击和几条命令。

先过硬件自检。装好显卡驱动后,在终端执行nvidia-smi,能显示出显卡信息才算数——本项目所有算力都在本地,没有英伟达显卡,后面三个服务都起不来。磁盘方面,Windows 机器要求有 D 盘且空闲 30G 以上(存数字人和作品),C 盘空闲 100G 以上(存镜像)。C 盘不够的话,装好 Docker 后在设置里把镜像目录挪到大磁盘:

装 WSL 和 Docker Desktop。终端里wsl --install(网络原因可能失败,多试几次,中途设置的用户名密码要记住),再wsl --update更新一下,然后从 Docker 官网下载安装包,按提示接受协议、跳过登录即可。

拉起来三个 AI 服务。把仓库 clone 下来(需要时执行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar),进入deploy目录执行docker-compose up -d。接下来约半小时、70G 左右的镜像下载,记得连 WiFi。判定成功的标准很直白:Docker 里出现 tts、asr、gen-video 三个服务且都是 Running 状态

装客户端,做第一条视频。Windows 从官方 Releases 下载Duix.Avatar-x.x.x-setup.exe双击安装;Ubuntu 用 AppImage 直接运行。打开客户端,点"创建数字人"上传一段 10 秒左右、有清晰人声的视频,起个名字,等形象训练完成;再点"创建视频",输入一段文案,提交生成。作品列表里能看到进度条,跑完后直接预览、导出。

核心流程拆解:10 秒视频是怎么变成数字人的

上传的视频为什么必须有人声。很多人栽在这里:上传的是一段无声 B-roll,结果建模特直接报错。原因很简单——声音克隆就靠这段视频里的声音,程序会用 ffmpeg 把音频从视频里抠出来送去做语音训练,没有声音就没有参考音频。所以录的时候记得对着镜头正常说话,10 秒左右即可。

文字和音频两条路进同一条流水线。你输入的文字会先发给本地 TTS 服务(端口 18180),用你克隆的声音合成语音;你上传的音频则直接使用。接着音视频一起送给视频合成服务(端口 8383)做口型对齐。任务不会同时开工,而是进队列逐个处理,界面上能看到"第 x / 共 y 个"的排队位置和实时进度,所以一次提交一整天文案也完全没问题。

模特与作品是两套独立的管理。模特(形象)支持分页、搜索、删除,删模特会连同它的视频和参考音频一起清掉;作品(成品视频)同样可以预览、改名、导出到指定路径、删除。想深挖接口细节,模特训练在 src/main/service/model.js,视频合成与队列轮询在 src/main/service/video.js。

三个实战场景:装好之后你能做什么

个人 IP 口播账号。形象建一次,长期复用。以后每天的内容就变成"写文案 → 点生成",不用出镜、不用补录,一天更新几条也不累人。

课程、培训视频的批量制作。把长文案直接丢进去,队列系统会按顺序一条条渲染。晚上提交一批次日的课程视频,早上起来全部导出发走,是最典型的用法。

不爱露脸的商业口播。产品介绍、本地商家宣传,可以请一位配音员录干声,走"音频驱动"路线,数字人照着念,既统一形象又保留人声的细腻度。

按机器调优:进阶配置与跨平台差异

配置比较弱的机器。用 lite 版 compose 文件:在deploy目录执行docker-compose -f docker-compose-lite.yml up -d,只启动视频合成一个服务,省显存。

50 系新显卡(含 5090)。官方已适配,同样在deploy目录执行docker-compose -f docker-compose-5090.yml up -d;30、40 系用 CUDA 12.8 的也可以走这套。

Ubuntu 22.04 用户。装好 docker.io、docker-compose 和 NVIDIA Container Toolkit 后,执行docker-compose -f docker-compose-linux.yml up -d即可;客户端用 AppImage,root 用户下运行记得加--no-sandbox参数。

镜像拉取慢。在 Docker 设置的 Docker Engine 里加国内镜像源registry-mirrors,改完 Apply & restart:

数据存放位置。Windows 下数字人与作品数据默认落在D:\duix_avatar_data,语音参考文件目录可在 deploy/docker-compose.yml 里按需修改。另外社区里有 8G 显存可用的单镜像整合玩法(见 README 共创作品展),硬件吃紧可以先去翻翻。

排障手册:最容易翻车的四个问题与解法

docker-compose up -d报连接失败 / request canceled。Docker Hub 官方源不稳定,两个办法:开全局代理,或者按上一节配国内镜像源。

新增模特报错(提示 file 不存在之类)。九成是上传视频里没有人声,回去换一段"人在说话"的视频重建。

定制模特报 Connection refused(funasr 连接异常)。ASR 服务冷启动很慢,服务刚起来就操作会被拒连——等服务全部 Running 后再等几分钟再克隆。另外 16G 内存的机器可能根本起不动,这是 32G 起步的硬原因。

三个服务状态不对 / 怀疑显卡。按顺序查:nvidia-smi是否显示显卡 → 驱动是否最新 → 到deploy目录重新执行docker-compose up -d拉最新版 → 再看 常见问题文档 里有没有同款问题。

卡住时,先学会抓两边的日志。客户端:右上角设置菜单点"打开日志",日志文件在AppData\Roaming\heygem.ai\logs下的main.log

服务端:在 Docker Desktop 点开对应容器的 Logs 页签,直接点复制图标把日志拷出来,配合报错时间戳去找问题:

开始前的边界提醒

克隆自己的形象和声音、用于个人创作与研究,是它的主场;未经本人同意不要克隆他人的脸和声音,不要用数字人产出误导性的商业内容。商用前请读一遍 LICENSE 与仓库内的模型社区许可协议——用户量超 10 万或年营收超千万美元的企业需要签署商业许可。也因为全离线运行,你的脚本和素材天然不落外网,隐私上是加分项。

今晚就开始:做出第一条数字人视频

一句话收束:一段 10 秒视频、一下午的部署时间,换来一个 7×24 小时在线的"数字分身",文案进、视频出,从此不靠出镜。现在就剪一段自己说话的 10 秒视频存好,按上面的链路把环境搭起来,今晚就能看它开口说话。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 4:10:21

Simulink实现车辆相平面分析与稳定性控制

1. 项目背景与核心概念解析在车辆动力学控制领域,相平面分析法是一种经典的稳定性评估方法。质心侧偏角和横摆角速度作为车辆横向运动的两个关键状态变量,其相平面图能够直观反映车辆在不同工况下的动态特性。Simulink作为MATLAB中的模块化仿真环境&…

作者头像 李华
网站建设 2026/9/11 4:10:19

鸿道实时操作系统:半导体装备控制的国产硬实时底座

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 4:10:17

2026年9月平板选购指南:绘画、办公与二合一设备的分层决策逻辑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 4:08:50

VMware Workstation虚拟网络配置与排查:NAT/桥接/仅主机模式详解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 4:08:27

热传导理论在多物理场耦合仿真中的关键作用与实践

1. 热传导理论在多物理场耦合仿真中的核心地位热传导理论作为经典传热学的三大基础理论之一,在当今工程仿真领域扮演着不可替代的角色。我从事CAE仿真工作十二年来,处理过数百个涉及热力耦合的工业案例,深刻体会到准确理解热传导机理对仿真结…

作者头像 李华
网站建设 2026/9/11 4:08:21

电子元器件检测:YOLO选型与大模型协同的工业落地实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华