news 2026/9/11 6:20:26

Duix.Avatar本地数字人视频生成完全指南:一段10秒视频克隆自己,免费生成口播视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Duix.Avatar本地数字人视频生成完全指南:一段10秒视频克隆自己,免费生成口播视频

Duix.Avatar本地数字人视频生成完全指南:一段10秒视频克隆自己,免费生成口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款真·开源的本地数字人项目。你只需提供一段 10 秒左右、自己出镜说话的视频,就能完成形象和声音的双克隆;之后输入文案,它会自动生成口型对得上的口播视频。全程在你的电脑上离线运行,素材不会上传到任何云端。如果你需要做产品口播、课程录课或个人短视频,又不想为付费数字人服务掏钱,这篇指南带你从零跑到第一个成片。

它到底能帮你解决什么

先说清楚它值不值得你花时间装:下面三个场景,有一个对上号就值得动手。

把"出镜"这件事一劳永逸拍口播视频最贵的是人:打光、布景、重录、后期。用 Duix.Avatar 克隆一次自己的形象和声音后,数字人模型会一直存在"我的形象"列表里,以后写什么文案就说什么文案,不再需要真人站在镜头前。

批量产出数字人口播视频同一形象可以反复使用。今天生成产品介绍,明天生成课程讲解,后天生成节日问候——画面人物始终是你,只有文案在变,内容产出的边际成本接近于零。

素材和数据留在本机从视频分离、声音克隆到音视频合成,整条链路都在本地 GPU 上完成。对不能把人脸、声音素材交给云服务的团队和个人来说,这是选择本地部署而不是在线 SaaS 的关键理由。

动手前的准备

这一段核对硬件配置、装好依赖并拉起服务端,是后面一切的地基。

机器要求(硬性)

  • 一块英伟达显卡,且已正确安装显卡驱动——全部算力在本地 GPU 上,没有它服务起不来
  • 内存 32G 及以上;参考配置:i5-13400F + RTX 4070
  • 磁盘:Windows 下需要 D 盘存放数字人和作品(空闲 30G 以上),Docker 镜像默认写在 C 盘(空闲 100G 以上,首次启动要下载约 70G 镜像)
  • 系统:Windows 10 19042.1526 及以上,或 Ubuntu 22.04

装软件

  1. Windows 先在终端执行wsl --install装好 WSL,再安装 Docker Desktop 并首次启动(接受协议、跳过登录即可)
  2. 安装最新的英伟达显卡驱动,装完执行nvidia-smi,能显示出显卡信息就算成功
  3. 如果打算从源码构建客户端,另外装 Node.js 18;直接用官方打包好的客户端则不需要

获取项目并启动服务端

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar

克隆完成后,进入项目的 deploy/ 目录,执行下面这条命令启动服务端:

cd deploy docker-compose up -d

首次拉取镜像约需半小时,建议连 WiFi。在 Docker 里看到 asr、tts、gen-video 三个服务都变为 Running,服务端就就绪了。显存紧张可以改用轻量版(只启动视频合成一个服务),在命令里加-f docker-compose-lite.yml;Ubuntu 用户则用docker-compose-linux.yml

C 盘空间不够的话,不要硬装:打开 Docker Desktop 的设置 → Resources,把磁盘镜像位置改到剩余空间 100G 以上的磁盘。

客户端从项目 Releases 获取官方安装包:Windows 是 .exe 安装程序,Ubuntu 是 AppImage,双击即可启动。

第一次跑通

目标只有一个:四步生成第一条数字人视频。先看到成片,再回头研究细节。

  1. 打开客户端,点Create Avatar(创建形象),上传一段 10 秒左右的说话视频
  2. 注意两个硬性条件:视频必须有声音,且必须是本人在说话——程序要用这段声音做声音克隆
  3. 等模型生成完毕,"我的形象"里会出现你的数字人
  4. Create Video(创建视频),选中刚建好的形象,输入一段文案,点击生成

成片会出现在"我的作品"里,可以直接预览和保存。到这里,最小闭环已经跑通。

核心能力拆解

下面三个能力就是这个项目值钱的地方,逐个讲清它是什么、怎么用、适合谁。

声音与形象双克隆

你上传的说话视频会被拆成两路处理:一路分离出纯语音,送入语音服务(基于 fish-speech 模型)完成声音克隆,同时用语音识别(基于 fun-asr)把视频里的话转成文字作为参考;另一路无声视频用于构建形象模型。两条结果都会留存,供后续合成时反复调用。适合想拥有一个可长期复用的"数字分身"的人——克隆一次,无限次使用。

文字与语音驱动视频生成

克隆完成后,生成视频有两种入口:输入文字,系统先用你的克隆音色合成语音,再由视频服务驱动数字人做口型并合成音视频;或者直接上传现成的音频文件,跳过文字转语音这一步,让它按音频的节奏驱动口型。脚本支持中、英、日、韩、法、德、阿拉伯语、西班牙语共 8 种语言。适合做系列口播、多语言内容搬运和日常播报视频。

开放 API,接入你自己的系统

服务端启动后会在本机暴露端口:声音克隆与语音合成走 18180 端口,视频合成任务提交和进度查询走 8383 端口。想集成进自己的产品?调用代码就在客户端源码 src/main/service/ 里,照着写就行。适合需要把数字人能力嵌进自有业务系统的开发者。

让效果更好的调优清单

  • 克隆素材:光线均匀、正面出镜、无遮挡、人声清晰稳定;宁可重录 10 秒干净的,也别用带环境音的长视频
  • 长文案:分段生成再拼接,别一次塞超长文本排队
  • 50 系列显卡:在 deploy/ 目录改用docker-compose -f docker-compose-5090.yml up -d(30/40 系列配 CUDA 12.8 也可用这套)
  • 磁盘:镜像下载约 70G,C 盘不够就按前文改 Docker 磁盘位置,不要边下边清理
  • 保持更新:项目更新频繁,不少问题新版已修;服务端到 deploy 目录重新执行docker-compose up -d,客户端拉取代码后重新构建

卡住了怎么办

按"问题—原因—解法"速查这四条,更多细节看 常见问题文档。

问题一:docker-compose up -d报连接 registry-1.docker.io 超时原因:Docker Hub 官方源连接不稳定。 解法:开全局代理,或在 Docker 的 daemon.json 里给registry-mirrors配置国内镜像源,保存、重启 Docker 后重新执行命令。

问题二:新增模特(克隆形象)时直接报错失败原因:上传的视频没有声音,或画面里没有人说话,声音克隆无料可用。 解法:重录一段 10 秒左右、人声清晰的说话视频再上传。

问题三:三个 Docker 服务起不来或反复重启原因:缺英伟达显卡,或驱动没装好,本地 GPU 算力无法挂载。 解法:执行nvidia-smi确认能显示显卡信息,安装或更新驱动后重启服务。

问题四:报错信息看不明白,定位不到原因解法:两端都看日志。客户端点右上角设置里的"Open Log"查看本地日志;Docker 中点进对应服务,打开日志面板,把关键几行复制出来对照排查。

你的本地数字人工作台已经搭好。先去生成一条口播视频,感受一下嘴型与声音的效果,再尝试 8 种语言脚本和开放 API,让它慢慢变成你的内容生产线。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 6:16:53

MLO基板深度解析:从5G毫米波天线封装到供应商选型指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 6:16:31

定义 Linera 应用 ABI:从零构建跨 Wasm 与原生架构的接口层

定义 Linera 应用 ABI:从零构建跨 Wasm 与原生架构的接口层 【免费下载链接】linera-protocol Main repository for the Linera protocol 项目地址: https://gitcode.com/GitHub_Trending/li/linera-protocol Linera 应用的 Application Binary Interface&am…

作者头像 李华
网站建设 2026/9/11 6:13:57

制造业iPaaS系统集成:打破数据孤岛的实践方案

1. 制造业iPaaS系统集成方案概述在传统制造企业中,ERP、MES、SCM等系统往往各自为政,形成数据孤岛。我曾参与过一家汽车零部件企业的数字化转型项目,他们的生产数据需要人工在三个系统间来回录入,不仅效率低下,每月还会…

作者头像 李华
网站建设 2026/9/11 6:13:53

Java线程协作:Condition机制原理与实践

1. Java线程协作中的Condition机制解析在Java并发编程中,Condition接口为线程间的精确协作提供了比传统wait/notify更灵活的控制手段。我首次在生产环境使用Condition是在实现一个高并发的订单状态机时,需要精确控制不同状态转换的线程唤醒条件。与基础的…

作者头像 李华