news 2026/9/11 6:24:04

本地 AI 数字人免费上手:用 10 秒视频克隆你自己的开源数字分身

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
本地 AI 数字人免费上手:用 10 秒视频克隆你自己的开源数字分身

本地 AI 数字人免费上手:用 10 秒视频克隆你自己的开源数字分身

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

不花一分钱、不用把素材传上云,就能得到一个会开口说话、五官和你几乎一样的数字分身——这就是 Duix.Avatar 想做的事。它是一个完全开源、本地离线跑的 AI 数字人克隆工具:丢一段 10 秒左右的视频进去,它把你的形象和声音都克隆下来,之后输入文字,就能生成一段口播视频,全程在你自己的机器上完成。

开篇钩子

先说个反常识的点:很多人以为搞数字人要么买几万块的商业服务,要么自己搭一套 3D 引擎。Duix.Avatar 走的是另一条路——用真人视频直接训练,把"形象+声音"两样东西一次克隆完,然后靠一段文字去驱动它说话。整个过程不需要联网,你的脸、你的声音、你生成的视频,全都留在本地硬盘里。下面按我实际跑通的路子,把"能不能装、怎么装、怎么做出第一个、卡住了怎么办"一次讲透。

先筛人:谁适合用 / 谁先别装

装之前先做个体检,能省你半小时的折腾。这个项目所有算力都吃本地 GPU,门槛写得很死,对照一下:

  • 系统:Windows 10(19042.1526 或更高),或者 Ubuntu 22.04 桌面版。其他 Linux 版本官方没做兼容测试,能跑算运气。
  • 显卡:必须有 NVIDIA 显卡,并且驱动装好。这是硬条件,AMD 或核显的机器三个服务直接起不来,不用往下试了。
  • 内存:32GB 是官方推荐,16GB 是下限,低于这个值 ASR 服务可能起不来。
  • 硬盘:Windows 要分两块看,C 盘存服务镜像要留 100GB 以上,D 盘存数字人和作品数据要留 30GB 以上;Linux 留 100GB 空余即可。
  • 网络:只在你第一次拉镜像时需要联网,大概 70GB 流量,之后可以彻底断网用。

适合:想白嫖一个能商用的本地数字人、手里有 N 卡、能接受"装的时候等一会儿"的人。先别装:只有核显/A 卡的机器、硬盘空间紧张到挤不出 100GB、或者希望零配置三分钟出活的——这工具不适合你,先看别的方案。

本地部署全流程

部署分两步:先把三个服务端容器拉起来,再装客户端。顺序别反,客户端要连着服务端才能干活。

服务端,Windows

  1. 先确认 WSL 在不在,终端里敲wsl --list --verbose,有列表就说明装过了;没有就wsl --install
  2. 顺手更新一下:wsl --update
  3. 装 Docker Desktop,首次运行接受协议、跳过登录。
  4. 进项目目录的/deploy,敲docker-compose up -d。想省资源用轻量版,就docker-compose -f docker-compose-lite.yml up -d(轻量版只有一个服务)。
  5. 50 系显卡(30/40 系用 CUDA 12.8 也行)单独有套配置:docker-compose -f docker-compose-5090.yml up -d

如果 C 盘不满 100GB,装完 Docker 后在这个"Disk image location"里换个空间够大的盘就行,别硬塞 C 盘。

这一步最费时间,下载加启动差不多半小时,网速说了算,建议连 WiFi 干等。看到 Docker 里三个服务都变 Running 就成了(轻量版是一个)。如果仓库是现拉的,源地址是git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar

服务端,Ubuntu 22.04

docker --version看看有没有 Docker,没有就sudo apt update后装docker.iodocker-compose。再装好 NVIDIA 驱动,敲nvidia-smi能打印出显卡信息才算数。最后:

cd /deploy docker-compose -f docker-compose-linux.yml up -d

客户端

服务端起来后,从项目发布页下载对应系统的安装包。Windows 双击Duix.Avatar-x.x.x-setup.exe装好就行;Ubuntu 是Duix.Avatar-x.x.x.AppImage,双击启动、不用装。注意一点:如果你是 root 用户进桌面,AppImage 双击可能打不开,用命令行加参数启动./Duix.Avatar-x.x.x.AppImage --no-sandbox就能解决。

做出你的第一个数字人

服务端 Running、客户端能连上之后,就可以真正"造分身"了。流程就三步:备素材、克隆建模、出视频。

素材怎么拍才清晰

10 到 20 秒最合适:太短特征不够,太长处理慢。人正对镜头、光线均匀,别侧脸别挡脸;背景越干净越好;关键是一定要有人声,因为声音是靠这段视频来克隆的,没声音的片源直接废。

克隆建模

主界面点"Create Avatar",选你那段视频。后台会自动做三件事:先把视频转成 H264、用 ffmpeg 把音轨抽出来、再拿音频去做声音训练,形象则交给视频本身。这一步通常几分钟,耐心等它跑完,别中途关服务。

生成第一条口播视频

形象建好后,在"My Avatars"里挑它,输入要说的文案(支持中、英、日、韩、法、德、阿拉伯、西八种语言),点生成。客户端会先把文字合成为你克隆的那个声音,再驱动形象对口型,最后拼成视频。文案长了就等久点,完成后到"My Works"里看成果。

让效果更好的几个细节

效果好不好,八成交给输入。几条我反复验证过的经验,照着做能省很多返工:

  • 光线 > 一切。脸上有阴影、逆光、忽明忽暗,口型都会跟着歪。找个均匀的光源正拍,比任何参数都管用。
  • 时长宁短勿滥。10 秒干净利落的,胜过长达一分钟却晃动、有杂音的。
  • 发音要标准、语速别太快。声音克隆吃你这段话的语调和节奏,含糊其辞会让克隆出来的音色也发虚。
  • 背景纯色或简单,AI 定位五官更轻松。
  • 想测多语言,先拿中文把形象调顺了再换语言,别一步到位。

一句话:(均匀光线 + 正面角度 + 清晰人声 + 干净背景) × 10~20秒 = 稳定可用。输入干净,输出才稳。

踩坑急救

问题我按"现象 → 原因 → 你该干嘛"列出来,对号入座就行。更多细节可以看 常见问题。

现象:docker-compose up -d拉镜像失败,报Connection refused/request canceled原因:Docker Hub 官方源连不上,跟你的代码无关。 动作:给 Docker 配个国内镜像源。打开 Docker Desktop → Settings → Docker Engine,在registry-mirrors里加几个可用的源,Apply & restart,再重新拉。

现象:新增模特时报错,或克隆直接失败原因:片源没声音,或者人没在说话。声音克隆拿不到可用音频就报不出来。 动作:换一段"有清晰人声"的视频重来。

现象:提示Connection refused,卡在 ASR 建连原因:Duix.Avatar-asr服务启动慢,服务端刚起就急着克隆,它还没就绪;内存太小(比如 16G)也可能起不来。 动作:服务全 Running 后等几分钟再操作;16G 内存的机器优先考虑加内存或轻量版。

现象:生成卡在 20% 不动原因:大概率是音频处理环节,tts 服务找不到文件、路径或权限不对。 动作:打开对应容器(tts 那个)看 Logs,定位报错行,常见是音频路径/权限问题,修好路径再试。

现象:端口被占、服务冲突动作:确认 8383、18180 没被别的程序占用。Windows 用netstat -ano | findstr :8383,Linux 用lsof -i :8383,找到占用进程后关掉或改端口。

提个小建议:所有三个服务都确认 Running、N 卡驱动nvidia-smi正常、服务端客户端都更新到最新版,再去问社区,省得被反复追问基础信息。

还能拿来干嘛

这工具别只当玩具,几个我见过用得顺的场景,挑一个对照:

  • 内容创作者:一次录好形象,之后批量出片、多平台分发,还能同一形象做外语版本。
  • 教育培训:固定讲师形象做课件,统一口播、批量生成,还能预录常见问答。
  • 企业场景:品牌代言人口播、FAQ 视频、内部培训材料,省掉反复约摄影师和配音。

共性就一条:把"录一次"的成本摊薄到无限次"生成"。

性能与进阶

想快想稳,从两处下手:硬件档位,和把流程接到 API 上。

硬件档位参考

档位GPU内存一条视频大约耗时
入门RTX 3060 12GB16GB几分钟
推荐RTX 4070 12GB32GB1-2 分钟级
专业RTX 4090 24GB64GB数十秒级

软件侧的提速:跑的时候把吃 GPU 的后台程序关了;SSD 放镜像和模型,加载明显更快;Docker 的 CPU/内存上限给足,别让容器饿着;N 卡驱动保持最新。

接 API 做批量

服务端起来后,本地会暴露几个端口,能直接调,不用走界面,适合批量和自动化:

  • 模型训练:参考 模型训练,先把视频分离成静音画面+音频,音频放到约定目录,再调预处理接口。
  • 音频合成:http://127.0.0.1:18180/v1/invoke,把上一步返回的参考音频和文本带进去,见 语音合成。
  • 视频合成:http://127.0.0.1:8383/easy/submit提交,http://127.0.0.1:8383/easy/query?code=xxx轮询进度,见 视频合成。

资源管理:不用的数字人删掉释放空间;重要的形象定期备份到外置存储;不同时期打不同标签,别堆成一锅。

上手路线

给自己排个三步走,别一步到生产:

  • 第 1 周,先跑通。按前面的流程把环境搭起来,用手机拍 10 秒自拍,克隆一个,喂一段简单文字出条视频,确认链路完整、速度你能接受。
  • 第 2-4 周,调质量。上更好的拍摄设备,试多语言,把 API 接进你现有的工作流,顺手按硬件做点参数调优。
  • 1 个月后,再谈规模化。定一套"建形象→出片"的标准流程,把经验沉淀成文档,批量克隆不同形象对应不同场景。

回到开头那句话:不花钱、不联网、10 秒一个分身,这套东西最实在的地方就在这。先把最笨的 10 秒视频跑出来,剩下的都是在这条能跑通的路子上加细节。遇到卡住的,别急着问,先翻一遍 常见问题,大多数坑都已经被前人踩过、写进文档里了。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 6:23:27

微信聊天记录导出完整指南:WeChatMsg 零基础上手

微信聊天记录导出完整指南:WeChatMsg 零基础上手 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_Trending/we/WeChatMsg …

作者头像 李华
网站建设 2026/9/11 6:16:53

MLO基板深度解析:从5G毫米波天线封装到供应商选型指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 6:16:31

定义 Linera 应用 ABI:从零构建跨 Wasm 与原生架构的接口层

定义 Linera 应用 ABI:从零构建跨 Wasm 与原生架构的接口层 【免费下载链接】linera-protocol Main repository for the Linera protocol 项目地址: https://gitcode.com/GitHub_Trending/li/linera-protocol Linera 应用的 Application Binary Interface&am…

作者头像 李华