Duix.Avatar 完整部署指南:如何在一台 Windows 电脑上快速跑通离线数字人视频生成
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款完全离线、可本地部署的开源数字人工具:上传一段 10 秒左右的说话视频,克隆你的形象和声音,之后输入文字或上传音频就能生成口播视频,数据全程不出本机。适合想把数字人素材留在内网、又不想按条付费的个人创作者与中小企业。
它解决了什么问题:全离线数字人对比云端方案的三个差别
市面上多数数字人服务是 SaaS:素材传到对方服务器,按生成条数收费。Duix.Avatar 把整条链路搬到你自己的电脑上:
- 隐私:素材视频、声音样本、文案全部在本地处理,不经过任何服务器,适合合规和素材保密要求高的场景
- 成本:部署完成后生成不限次数、免费,支持全球免费商用(用户量超 10 万或年营收超 1000 万美元的企业需签署商业许可协议)
- 门槛:代价是你需要一块英伟达显卡,并愿意跟着 Docker 走一遍部署流程(下一节给全命令,可直接复制)
💡 不确定自己是否有英伟达显卡?命令行里敲nvidia-smi,能显示显卡信息就能继续。
它是怎么工作的:从 10 秒素材到口播成片的完整链路
服务端由三个 Docker 服务组成,各管一段:
- FunASR(语音识别,即把人说过的话转成文字的技术):转写素材视频里的声音
- fish-speech(语音合成,即让机器用某个人的音色说出新文字):从声音里学习你的音色
- duix.avatar(口型合成):把静音视频的画面与新音频对齐,产出成片
整条旅程是:上传约 10 秒的人声说话视频 → 客户端自动拆成"静音视频 + 音频" → 前两个服务分别提取外观与音色特征,得到一个可命名的数字人模型;之后输入文案(脚本支持中、英、日、韩等八种语言)或上传音频,系统自动生成对应语音、匹配口型,导出成片。
如何跑起来:显卡最低要求、部署命令与部署后三步验证
硬件要求
| 项目 | 最低 | 推荐 |
|---|---|---|
| 系统 | Windows 10 19042+ 或 Ubuntu 22.04 | Windows 11 / Ubuntu 22.04 |
| 显卡 | 任意英伟达(装好驱动) | RTX 4070 12G |
| 显存 | 8G(跑 lite 轻量版) | 12G(标准版) |
| 内存 | 32G(项目明确必要项) | 32G+ |
| CPU | i5 级及以上 | 13 代 i5-13400F |
| 磁盘 | 100G+ 空闲(Windows:C 盘 100G 镜像 + D 盘 30G 数据) | 200G 固态硬盘 |
部署命令
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d # 8G 显存显卡改用轻量版: # docker-compose -f docker-compose-lite.yml up -d首次拉取镜像约 70G 流量,耗时半小时左右,建议连 WiFi。磁盘空间不足或想换分区存放镜像,可在 Docker 设置的 Resources 页修改 Disk image location:
NVIDIA 50 系显卡在 deploy/ 目录下用 5090 对应的配置文件启动,Ubuntu 22.04 则改用 linux 对应的配置文件(文件名在目录下可见)。服务端起来后,下载官方客户端安装包双击即可使用。
部署后三步验证
- 看服务:Docker 列表中标准版三个服务(tts、asr、gen-video)全部 Running,lite 版只有 gen-video
- 看显卡:
nvidia-smi能显示显卡与驱动版本 ✅ - 跑通全链路:打开客户端,用 10 秒视频创建一个模特,出现在列表里即说明识别、合成、视频三段都正常
如何让效果更好:素材拍摄与显存配置调优清单
- 素材视频必须是有声音、人在说话的清晰片段——程序用这段声音做克隆,音质决定音色上限
- 拍摄时正面、光线充足均匀、背景纯色——减少口型错位与背景干扰
- 8G 显存的机器用 lite 轻量版——避免显存不足导致服务崩溃
- 拉镜像慢或失败——在
/etc/docker/daemon.json配置国内镜像源,细节见 doc/常见问题.md - 需要多个人设——为不同人员各建一个模特,在客户端随时切换复用
哪些情况值得用它:四类适合本地数字人的场景
- 自媒体口播量产:录一次,之后换文案出片,适合产品介绍、栏目系列更新
- 企业内部培训与合规内容:素材与成片全程不出内网,敏感内容更安心
- 预算有限的小团队:8G 显存加 lite 版即可跑,且无按次计费
- 开发者接入自有系统:本地服务在
127.0.0.1开放 API(如视频合成在 8383 端口),调用示例可参考 src/main/service/
适合谁不适合谁:一句话总评与劝退名单
一句话:它是门槛最低的"开箱即用"开源数字人方案,代价是放弃云端的省心。
- 推荐:有英伟达显卡、在意素材隐私、想免费商用的人,部署一次即可长期使用
- 劝退:Mac 或无英伟达显卡(全部算力依赖 GPU)、不想碰 Docker、追求电影级高精细画面(官方定位本地版口型效果为"可用",商用 API 版更精细)
- ⚠️ 用户量超 10 万或年营收超 1000 万美元的企业商用前需签署商业许可协议,详见 LICENSE
部署遇到问题时,先按上面三步自查,绝大多数坑在 doc/常见问题.md 里都有对应解法。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考