news 2026/9/11 7:16:35

OpenVoice 即时语音克隆快速教程:几秒音频 3 步跑通,附避坑清单

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
OpenVoice 即时语音克隆快速教程:几秒音频 3 步跑通,附避坑清单

OpenVoice 即时语音克隆快速教程:几秒音频 3 步跑通,附避坑清单

【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice

OpenVoice 是 MIT 与 MyShell 开源的即时语音克隆模型:上传几秒干净人声作为参考音频,即可让任意文本用这个人的音色朗读,支持跨语言零样本克隆(参考音频和输出文本可以是不同语言)。V1 与 V2 均为 MIT 协议,商用免费。本地部署需 GPU,显存 4GB 起步;没有硬件可直接用官方在线服务,零安装。

它是怎么工作的:语音克隆原理 30 秒版

数据流分三段:输入——文本 + 风格参数(情感、语调、节奏)进基础 TTS 模型(生成语音的底层模型),同时参考音频进音色提取器(把音频压成音色特征向量的部件);中间环节——音色转换模块把合成语音的音色特征替换成参考人的,风格参数原样保留;输出——一段"像那个人"的声音,但情感和节奏由你指定。

两种跑法:在线零安装到本地部署命令

在线体验:3 步跑通(零安装)

  1. 在 Workshop 创建一个 Bot,设置里开启 Voice (TTS);
  2. 在 Widget Center 的 TTS 分类挑一个基础音色试听,语言入口共 9 个:英式英语、美式英语、中文、日语、韩语、西班牙语、法语等;
  3. 用 voice cloning 上传几秒参考音频、输入要朗读的文本,几秒后拿到同音色结果。参考音频本身可以是任意语言。

本地部署(Linux):一个命令块

conda create -n openvoice python=3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .

装完把官方权重解压:V1 放到checkpoints目录,V2 放到checkpoints_v2目录;V2 还要按 docs/USAGE.md 的 V2 章节补装 MeloTTS 相关组件。然后启动本地 Gradio 页面(浏览器里操作的 Web 界面):

python -m openvoice_app --share

边界一览:语音克隆能做与不能做

能做不能做 + 替代方案
上传几秒干净人声即可克隆音色,生成同音色语音只克隆音色,不克隆情感、口音;想换这些得换基础 TTS 模型,换参考音频没用
音色与风格解耦,情感、语调、节奏可单独调无法克隆参考人的情感表达;这些由风格参数和基础 TTS 模型控制
V2 原生支持英、西、法、中、日、韩 6 种语言,可跨语言零样本克隆基础 TTS 模型不支持的语言无法直接输出;需换支持该语言的基础 TTS 模型
参考音频可以是任意语言参考音频必须干净:无背景噪音、单人说话、时长别太短;不达标就换一段干净参考音频

避坑速查:本地部署常见问题

  1. 生成的声音不像、音质差?参考音频带背景噪音、多人同说、太短或有长静音段。换几秒干净单人参考音频,并确认没复用旧文件名而残留processed缓存目录。
  2. 启动报找不到模型?权重没解压到指定目录。V1 解压到checkpoints,V2 解压到checkpoints_v2
  3. 首次运行卡在下载?openvoice/se_extractor.py 里的 silero-vad 组件首次调用会自动联网下载。断网环境手动下载该包并解压到~/.cache/torch/hub/对应目录。
  4. V2 提示缺依赖?除主包外还需要 MeloTTS 相关组件。按 docs/USAGE.md 的 V2 章节安装 MeloTTS 并执行 unidic 下载。
  5. 没有 GPU 或显存小于 4GB?本地推理跑不动。改用官方在线服务,或换带显卡的机器部署。

用在哪:4 个当天可接的场景

  • 🎬 视频配音:替换解说员音色不用重录,节奏和情感保持不动
  • 📚 有声内容与自媒体:同一音色批量产出多语言朗读,适合播客
  • 📱 语音助手:让智能设备用熟悉的声音回应
  • 🌐 多语言学习:同一位"人"用不同语言读同一段文本,方便对比发音与语调

要求是"只克隆音色、风格可调",且能提供几秒干净参考音频,OpenVoice 当天就能接进产品;期望连参考人的情感和口音一起克隆、或没有 GPU 还要稳定批处理,它不达标。MIT 协议商用免费,适合先做产品验证再谈规模化。延伸阅读:使用文档 docs/USAGE.md、常见问题 docs/QA.md、核心源码目录 openvoice/。

【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 7:15:56

用10秒视频克隆你的AI数字人:口播视频生成全在本地跑

用10秒视频克隆你的AI数字人:口播视频生成全在本地跑 【免费下载链接】Duix-Avatar 🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning. 项目地址: https://gitcode.com/GitHub_Trendin…

作者头像 李华
网站建设 2026/9/11 7:15:50

Maestro AI 测试指南:5 分钟跑通第一条自然语言断言

Maestro AI 测试指南:5 分钟跑通第一条自然语言断言 【免费下载链接】Maestro Painless E2E Automation for Mobile and Web 项目地址: https://gitcode.com/GitHub_Trending/ma/Maestro 界面一改版,移动 UI 自动化测试脚本就成片报红。你不用逐个…

作者头像 李华
网站建设 2026/9/11 7:14:38

无锡南途科技:GEO优化如何重构企业线上化交付标准

传统SEO时代与AI搜索时代的运营逻辑差异,正在从“关键词排名”转向“实体信任构建”。前者依赖页面标题与链接权重的匹配效率,后者则要求企业内容被大模型识别为可引用的权威信源。无锡南途科技有限公司(品牌英文名NATUX)在服务工…

作者头像 李华
网站建设 2026/9/11 7:14:27

IEEE33节点系统中泄流效应对无功优化的影响与Matlab实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 7:13:33

ZLUDA 在 AMD 显卡上跑起 CUDA 应用:三步配置与验证清单

ZLUDA 在 AMD 显卡上跑起 CUDA 应用:三步配置与验证清单 【免费下载链接】ZLUDA CUDA on non-NVIDIA GPUs 项目地址: https://gitcode.com/GitHub_Trending/zl/ZLUDA 你的 AMD 显卡跑不了 PyTorch 的 CUDA 版,原因是装不了 NVIDIA 驱动。ZLUDA 是…

作者头像 李华