news 2026/9/11 7:15:56

用10秒视频克隆你的AI数字人:口播视频生成全在本地跑

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
用10秒视频克隆你的AI数字人:口播视频生成全在本地跑

用10秒视频克隆你的AI数字人:口播视频生成全在本地跑

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一个完全离线的AI数字人开源项目:上传一段10秒视频即可完成数字人克隆,输入文案就能生成口播视频,全程在你的电脑上运行。适合自媒体创作者、培训讲师,以及不想把面部声音交给云端的开发者。

它帮你解决什么问题

  • 文案一改就要重新录制。你作为自媒体作者,一条3分钟口播视频说错一句就得重录;换个选题,还得换场地重新拍。克隆数字人后,只改文案,视频随时重新生成。
  • 外包贵、在线工具有隐私顾虑。定制3D数字人传统上要数万元,SaaS平台则要你把脸和声音传到别人的服务器。Duix.Avatar 全程本地运行,数据不出你的电脑。
  • 非技术同学不知道从哪下手。服务端一条 compose 命令拉起来,客户端是双击即开的应用,界面只有“创建数字人”和“创建视频”两个入口。

核心能力一览

  • 形象与声音克隆——上传一段带说话声音的10秒视频,得到一个可反复使用的数字人模型。
  • 文字驱动口播视频生成——输入文案,自动合成语音、对口型,输出成片。
  • 语音驱动——直接上传音频文件,用你自己的语气节奏让形象说话。
  • 多模型管理——导入多个数字人,一键切换,按不同选题批量出片。
  • 八种语言文案——中、英、日、韩、法、德、阿、西语都支持。
  • 本地开放 API——模型训练与视频合成接口在本地端口暴露,方便接入自己的系统。

图:客户端主界面,上方是“Create Video / Create Avatar”两个功能区,下方为数字人模型列表

5分钟跑通部署

前置条件:Windows 10(19042 以上)或 Ubuntu 22.04;NVIDIA 显卡并装好驱动(显存 8GB 以上更稳妥);Docker 镜像所在磁盘(默认 C 盘)留 100GB 以上,数据盘(默认 D 盘)留 30GB 以上。

第 1 步,克隆仓库:

# 克隆项目(唯一用到的外部操作) git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar

第 2 步,启动服务端:

# 进入 deploy 目录,一条命令拉起全部 3 个服务(lite 版换 docker-compose-lite.yml) cd Duix-Avatar/deploy && docker-compose up -d

⚠️ 命令本身 5 分钟搞定,但首次拉镜像约 70GB 流量、耗时半小时左右,记得连 WiFi。

第 3 步,安装客户端:Windows 双击官方包的Duix.Avatar-x.x.x-setup.exe;Ubuntu 双击Duix.Avatar-x.x.x.AppImage启动,root 用户需改用终端命令./Duix.Avatar-x.x.x.AppImage --no-sandbox

确认跑通:Docker 页面看到 duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video 三个容器均为 Running(lite 版只有 gen-video 一个),再打开客户端能进入主界面即可。

底层是怎么做到的(通俗版)

整条流水线像三个人分工,各跑在 Docker 服务里:

  • 识别(ASR):听你上传视频里的说话声,转写成文字,这份转写是声音克隆的参照材料。
  • 语音合成(TTS):从几秒音频里学你的音色,之后用你的语气朗读任意文案。
  • 视频合成:把合成音频叠到原视频画面上,驱动嘴部跟随声音动,输出成片。

客户端只是把这些请求转发给三个服务并跟踪进度的“调度员”,任务流转见 src/main/service/video.js,三个服务的端口与参数定义在 deploy/docker-compose.yml。

配置与性能参考:最低/推荐两档

项目最低配置推荐配置体验差异
CPU4 核通用处理器13 代 Intel i5-13400F 及以上核数越多,客户端操作与任务排队越顺
内存16GB32GB(官方标注必要)16GB 时 ASR 服务可能起不来
显卡8GB 显存的 NVIDIA 卡(社区反馈可用)RTX 4070显存更高,能扛更长视频与更高输出分辨率
存储镜像盘 100GB + 数据盘 30GB 空闲NVMe SSD首次镜像约 70GB,SSD 大文件读写更快

踩坑与排错

镜像下载慢、连接失败

  • 现象:docker-compose up -drequest canceled、超时类错误。
  • 原因:国内直连 Docker Hub 官方源不稳定。
  • 解法:在 daemon.json 的 registry-mirrors 添加国内镜像源,重启 Docker 再执行。

图:Docker 镜像加速源配置位置,添加后重启 Docker 生效

服务启动失败、容器反复重启

  • 现象:三个容器中某个起不来或不停重启。
  • 原因:项目算力全在 GPU——没有 NVIDIA 显卡、没装驱动,或镜像盘空间不足。
  • 解法:用nvidia-smi确认显卡;磁盘紧张时,在 Docker Desktop 的 Settings → Resources → Advanced 里把 WSL 磁盘镜像位置改到空间更大的盘。

图:Docker Desktop 中更改 WSL 磁盘镜像位置的入口(红框处 Browse 选择新磁盘)

显存不够、视频生成失败

  • 现象:生成任务报显存不足而失败。
  • 解法:调低输出分辨率或缩短单次时长;或改用 lite 版,只保留视频合成服务(docker-compose -f docker-compose-lite.yml up -d)。

模型克隆失败

  • 现象:上传视频报错,或服务刚起来就报 Connection refused。
  • 原因:克隆视频必须包含人声(声音是克隆素材);ASR 服务启动慢,16GB 内存可能带不动。
  • 解法:重录一段 10 秒以上、人声清晰的视频;服务端启动后等几分钟再操作;内存 16GB 建议升到 32GB。

端口冲突

  • 现象:容器都起来了,客户端却连不上本地服务。
  • 原因:18180、10095、8383 端口被其他程序占用。
  • 解法:在 deploy/docker-compose.yml 中改端口映射左侧数字(如 18180 改 18181),右侧容器端口不动。

仍定位不了?打开三个容器的 Logs 页,点右侧复制图标把完整报错文本提出来。

图:Docker 容器日志页,右侧复制图标可提取完整报错文本

适合谁、怎么用

  • 自媒体创作者:克隆自己一次,同一选题批量出同音色的口播视频,不用反复换场地。
  • 培训与课程:把标准化课纲做成固定形象的口播视频,多期学员反复复用。
  • 二次开发者:直接调用本地开放 API,把“输文案 → 出视频”嵌进自己的产品。

进阶方向:

  • 50 系显卡(30/40 系 cuda 12.8 环境也可试)可换 5090 专用 compose 文件部署。
  • 熟悉模特训练、音频合成、视频合成三个本地接口后,可搭自己的批量生成流水线。

Duix.Avatar 把“录一条口播视频”变成“输文案 → 拿成片”的本地流程,全程不出你的电脑。硬件满足的话,建议先克隆一个自己的模型试跑一遍。更多细节看官方文档:doc/常见问题.md

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 7:15:50

Maestro AI 测试指南:5 分钟跑通第一条自然语言断言

Maestro AI 测试指南:5 分钟跑通第一条自然语言断言 【免费下载链接】Maestro Painless E2E Automation for Mobile and Web 项目地址: https://gitcode.com/GitHub_Trending/ma/Maestro 界面一改版,移动 UI 自动化测试脚本就成片报红。你不用逐个…

作者头像 李华
网站建设 2026/9/11 7:14:38

无锡南途科技:GEO优化如何重构企业线上化交付标准

传统SEO时代与AI搜索时代的运营逻辑差异,正在从“关键词排名”转向“实体信任构建”。前者依赖页面标题与链接权重的匹配效率,后者则要求企业内容被大模型识别为可引用的权威信源。无锡南途科技有限公司(品牌英文名NATUX)在服务工…

作者头像 李华
网站建设 2026/9/11 7:14:27

IEEE33节点系统中泄流效应对无功优化的影响与Matlab实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 7:13:33

ZLUDA 在 AMD 显卡上跑起 CUDA 应用:三步配置与验证清单

ZLUDA 在 AMD 显卡上跑起 CUDA 应用:三步配置与验证清单 【免费下载链接】ZLUDA CUDA on non-NVIDIA GPUs 项目地址: https://gitcode.com/GitHub_Trending/zl/ZLUDA 你的 AMD 显卡跑不了 PyTorch 的 CUDA 版,原因是装不了 NVIDIA 驱动。ZLUDA 是…

作者头像 李华
网站建设 2026/9/11 7:12:24

判断 AlphaFold 结构预测是否可信:pLDDT 与 PAE 完整实操指南

判断 AlphaFold 结构预测是否可信:pLDDT 与 PAE 完整实操指南 【免费下载链接】alphafold Open source code for AlphaFold 2. 项目地址: https://gitcode.com/GitHub_Trending/al/alphafold 拿到 AlphaFold 的输出,第一眼别急着看结构多漂亮&…

作者头像 李华