3 步完成零样本语音克隆:让 AI 免费商用你的声音
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
你只有一段十几秒的录音,OpenVoice 就能克隆你的音色,让 AI 用"你的声音"说出任意文字。这是零样本语音克隆,不需要训练模型,MIT 许可,商用免费。
先说结果:它能帮你做成什么
- 录一段自己的声音,把产品文案、公告交给 AI,读出来就像你本人在念。
- 给视频、播客配音,不用每次亲自进录音棚。
- 参考音频是中文,也能生成英语、日语的语音——跨语言克隆,参考和生成的语言都可以没出现过。
语音克隆原理:一句话就能讲通
看这张 OpenVoice 语音克隆框架图,流程分两条线:一条是文本内容加风格参数,交给基础说话人 TTS 模型,决定"说什么、什么情绪和口音";另一条是你的参考音频,音调提取器从中抽出音色特征。最后两条线合到一起,由解码器合成语音——内容、风格、音色各管一段,这就是它既能换语言又能保留你音色的原因。
OpenVoice 实操:准备工作与 4 步分步操作
准备工作
在线体验:无需装任何东西,直接在 myshell.ai 的 Workshop 里搭一个 Bot 就能跑。
本地部署:克隆仓库,按 requirements.txt 装依赖,再下载模型权重解压到checkpoints_v2文件夹。
git clone https://gitcode.com/GitHub_Trending/op/OpenVoice4 步在 Workshop 里克隆你的声音
打开 Workshop,新建一个 Bot。这是语音克隆的起点,建好后你会得到一个空白画布,可以往里拖组件。
添加 TTS Widget。在组件区找到 TTS 相关选项拖进画布,这一步做完,画布上会出现一个可以输入文字、输出语音的模块。
点击任意一个 TTS 模型。这是 OpenVoice 的基础说话人,负责语气和口音。
选中后,模型会接入你的 Bot,之后所有生成都由它打底。
上传一段参考语音,输入文字,生成声音。系统分析音色特征后输出音频,听起来就是用你的声音在念那段文字。
本地跑通的话,用一行命令python -m openvoice_app --share起 Gradio 页面,操作逻辑一样;V2 用法可看 demo_part3.ipynb。
常见坑:4 条速查
- 参考音频要干净:带背景噪音、多人在场、中间夹长静音,音色都会跑偏。
- 同名音频记得清缓存:换了文件但没删
processed文件夹,用的还是旧的处理结果。 - 它只克隆音色,不克隆口音和情绪:想要什么情绪、什么口音,换对应的基础 TTS 模型就行。
- V2 原生支持 6 种语言:英、西、法、中、日、韩,音质也比 V1 更好;V1、V2 都免费商用。
最后
一段录音换一套"声音资产",剩下的就是文档里的事了:docs/USAGE.md。
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考