news 2026/9/11 2:01:28

Duix.Avatar开源数字人本地部署:10秒视频克隆形象与声音

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix.Avatar开源数字人本地部署:10秒视频克隆形象与声音

Duix.Avatar开源数字人本地部署:10秒视频克隆形象与声音

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar是一个免费开源的AI数字人项目,支持本地部署与API调用,全部计算在本机完成,运行过程不依赖外网。它解决的问题是:数字人商业服务收费高、素材需要上传云端。给出一段10秒左右的人脸说话视频,它能克隆这个人的外貌和声音;再输入文案或上传音频,即可生成口型同步的口播视频。最终产出是一个形象、音色均克隆自原素材的成片视频文件。客户端界面支持中、英、日、韩等8种语言。

效果先行:输入一段视频,得到一条口播视频

输入:一段10秒左右、人脸清晰可见且带说话声音的视频。输出:数字人朗读指定文案的视频,或由上传的音频直接驱动的成片。整个流程不经过任何云服务。

开始前需要确认的三件事

事项内容
开源授权与部署形态采用DUIX.COM社区协议,可免费商用;产品月活超过1000需向官方申请商业授权。服务端通过Docker运行asr、tts、gen-video三个服务(lite版仅一个),客户端为桌面程序
硬件最低要求英伟达NVIDIA显卡及正确驱动(必需);内存32G及以上(必需);Windows需D盘空闲30G以上、C盘存镜像需100G以上,Ubuntu需100G以上空闲磁盘;首次拉取镜像约70G流量
关键使用限制全部算力依赖GPU,无NVIDIA显卡或未装驱动则服务无法启动;用于创建形象的视频必须有说话声;16G内存可能不足以启动服务

部署:从克隆代码到服务就绪

  1. 获取代码并进入部署目录:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy
  1. 准备Docker与GPU支持。Windows:用wsl --list --verbose检查WSL(未装则wsl --install),执行wsl --update更新,再安装Docker Desktop;C盘空闲不足100G时,在Docker的Settings → Resources → Disk image location把镜像存储改到空闲大于100G的磁盘。Ubuntu 22.04:执行sudo apt install docker.io docker-compose,安装NVIDIA驱动与NVIDIA Container Toolkit,用nvidia-smi确认显卡可用后重启Docker。

  2. 在deploy目录启动服务:

# Windows docker-compose up -d # Ubuntu docker-compose -f docker-compose-linux.yml up -d

RTX 50系列显卡改用docker-compose -f docker-compose-5090.yml up -d;显存较小可用lite版docker-compose -f docker-compose-lite.yml up -d,lite版只启动视频生成一个服务。

  1. 等待约半小时完成镜像下载。duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个服务全部Running后服务端就绪,本地开放端口为8383(视频合成)、18180(语音合成)、10095(语音识别)。

  2. 安装客户端:Windows双击官方Release的Duix.Avatar-x.x.x-setup.exe;Ubuntu双击.AppImage即可运行,root用户需在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox

上手三步:从克隆形象到第一条视频

第一步:创建形象。客户端首页点击"Create Avatar"上传视频素材,训练完成后数字人出现在"My Avatars"列表中。

第二步:生成首条视频。点击"Create Video",选择目标数字人,输入要朗读的文案或上传音频文件,点击生成。系统先将文案合成为克隆音色,再驱动口型输出成片。

第三步:管理作品。生成的视频统一存放在"My Works",支持关键词搜索和分页浏览。右上角Setting菜单可打开客户端日志、切换界面语言。

卡住时先查这三处

现象常见原因处理方式
docker-compose up -d报连接超时Docker Hub官方源连接不稳定/etc/docker/daemon.jsonregistry-mirrors添加国内镜像源后重启Docker
新增模特时报错形象视频没有声音,或视频中没有人说话更换带清晰人声的视频重新创建
定制模特报Connection refusedASR服务启动慢,10095端口未就绪;16G内存机器资源不足等服务全部Running后再等几分钟创建形象;16G内存仍失败则升级内存

查看详细日志时,在Docker Desktop打开对应容器的Logs页面即可。heygen-tts日志中出现"file not exists",通常是客户端与容器约定的音频路径不一致。

它适合谁,不适合谁

适合:需要批量产出口播视频且素材必须留在本地的内容生产场景;想把数字人接入既有系统的开发者——项目暴露本地HTTP接口,调用方式可直接参考 src/main/service/video.js 及同目录的 model.js、voice.js。

不适合:无NVIDIA显卡的机器,全部算力依赖GPU;月活超过1000的产品,需先取得商业授权;实时交互场景,本项目只处理"文案或音频到成片口播视频"的单向流程,不支持实时对话。

更多部署问题与自查步骤见 doc/常见问题.md。这套开源数字人方案的落地成本主要是磁盘空间和GPU性能,实际生成速度取决于本机显卡。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 1:58:09

长沙影视后期培训哪家好,企业真实项目带练资深老师作品集指导

正文摘要 本文从真实项目带练、专业实训环境、资深师资授课、系统化作品集指导四个维度,拆解长沙影视后期培训的培养质量差异,结合机构产教融合模式,为学习影视后期的大学生、转行者筛选机构提供客观参考依据。信息来源:长沙市人社…

作者头像 李华
网站建设 2026/9/11 1:56:24

MySQL数据库与表操作完全指南

1. MySQL数据库与表操作完全指南作为关系型数据库的标杆产品,MySQL在Web应用、企业系统和数据分析领域占据着不可替代的地位。我使用MySQL已有八年时间,从最初的简单CRUD操作到现在的复杂架构设计,积累了大量实战经验。本文将系统梳理数据库和…

作者头像 李华
网站建设 2026/9/11 1:55:42

C语言字符串排序实现与PTA题目解析

1. PTA字符串排序题目解析与实现思路这道来自PTA(Programming Teaching Assistant)平台的经典题目,考察的是对C语言字符串处理能力的掌握程度。题目要求编写程序,实现对多个字符串按字典序进行排序的功能。作为高校编程教学中常见…

作者头像 李华