news 2026/8/19 16:30:54

3 分钟救回被噪音毁掉的录音:ClearerVoice-Studio AI 语音处理上手指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
3 分钟救回被噪音毁掉的录音:ClearerVoice-Studio AI 语音处理上手指南

3 分钟救回被噪音毁掉的录音:ClearerVoice-Studio AI 语音处理上手指南

【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio

如果你正被录音里的空调声、键盘声、背景人声折磨,这篇文章是写给你的。ClearerVoice-Studio 是一款开源的 AI 语音处理工具包,几行代码就能完成语音增强、人声分离、音质提升等操作,免费开源,新手也能快速上手。

先讲个真实场景:凌晨一点,录音"废"了

上周我熬夜剪一期播客,剪到凌晨一点导出,回放才发现整段人声背后全是空调的嗡嗡声和敲键盘的哒哒声。重新录?嘉宾档期约不上了。花钱找人修?报价高得离谱。后来同事丢给我一个开源项目,说"你跑两行命令试试"。试完我愣住了——那段以为要报废的录音,人声变得干净透亮,背景噪音像被橡皮擦擦掉了一样。这个项目,就是 ClearerVoice-Studio。

一句话看懂:它是声音界的"AI 修图师"

美图软件给照片"磨皮祛痘",ClearerVoice-Studio 则给声音做同样的事:自动识别并抹掉噪音、把混在一起的说话人分开、把模糊的音质变清晰。它由三部分组成:

  • ClearVoice:开箱即用的推理入口,加载预训练模型,几行代码出结果;
  • Train:面向开发者的训练与微调框架,想定制自己的模型就看这里;
  • SpeechScore:客观评测工具,量化"处理完到底变好了多少"。

内容创作者、想给产品加语音能力的开发者、只想抢救老录音的普通用户,它都适用。

处理前 vs 处理后:一张表看懂它能做什么

你的痛点对应任务现成预训练模型效果对比
背景噪音太重语音增强FRCRN_SE_16K、MossFormerGAN_SE_16K、MossFormer2_SE_48KDNS 测试集 PESQ 从 1.58 提到 3.57
多人说话分不清语音分离MossFormer2_SS_16K一次输出两条音轨,LRS2-2Mix 上 SI-SNRi 达 15.5
老录音音质发闷语音超分辨率MossFormer2_SR_48K16kHz/24kHz/32kHz 补全到 48kHz
视频里只想要特定人声目标说话人提取AV_MossFormer2_TSE_16K结合画面人脸与口型提取目标声音

换句话说:从"听不清"到"听清",从"混在一起"到"各归各位",它全包了。

四个真实场景,手把手带你跑通

开工前:两条命令装好环境

pip install clearvoice

装好后在代码里写from clearvoice import ClearVoice即可开工。只处理 WAV 的话这步就够;要处理 MP3、AAC、FLAC 等格式,再补装一个 FFmpeg。想从源码安装或参与开发,可以git clone https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio后进入clearvoice/目录执行pip install --editable .。仓库自带的demo.pydemo_with_more_comments.py可直接运行,python demo.py就能看到完整效果。

场景一:会议录音去噪,让领导听清你的汇报

from clearvoice import ClearVoice myClearVoice = ClearVoice(task='speech_enhancement', model_names=['MossFormer2_SE_48K']) output_wav = myClearVoice(input_path='samples/input.wav', online_write=False) myClearVoice.write(output_wav, output_path='samples/output_enhanced.wav')

大白话解释:第一行创建了一个"去噪器",指定使用全频带模型 MossFormer2_SE_48K;第二行把input.wav丢进去,模型返回处理后的音频数据;第三行把结果存成新文件。跑完直接播放对比,噪音基本消失、人声完整保留,模型文件会在首次运行时自动下载。这个语音降噪工具还提供 FRCRN_SE_16K、MossFormerGAN_SE_16K 两个 16kHz 版本,前者更轻快、后者效果更佳,按需挑选即可。

场景二:多人访谈人声分离,把两把声音拆开

myClearVoice = ClearVoice(task='speech_separation', model_names=['MossFormer2_SS_16K']) output_wav = myClearVoice(input_path='samples/input_ss.wav', online_write=False) myClearVoice.write(output_wav, output_path='samples/output_separated.wav')

代码几乎没变,只是把任务换成了speech_separation。它会将混在一起的两路人声分别输出为..._s1.wav..._s2.wav,相当于自动帮你"分轨"。在 LRS2-2Mix、WSJ0-2Mix 等公开基准上,MossFormer2_SS_16K 的分离指标超过了 Conv-TasNet 等经典模型,处于开源方案的第一梯队。

场景三:老旧录音的音频质量提升方法,从"糊"到"清"

采样率可以理解为声音的"清晰度档位":16kHz 相当于低清视频,48kHz 才接近高清。MossFormer2_SR_48K 能把低采样率音频"脑补"到 48kHz,让老录音丢失的高频细节回来。

myClearVoice = ClearVoice(task='speech_super_resolution', model_names=['MossFormer2_SR_48K']) output_wav = myClearVoice(input_path='samples/input_sr.wav', online_write=False) myClearVoice.write(output_wav, output_path='samples/output_sr_48k.wav')

如果音频又旧又吵,可以先用增强模型去噪、再做超分辨率,两步串起来就是一条完整的"翻新流水线"。

场景四:视频里只留下想听的那个人的声音

多人同框说话时,怎么只提取其中一人的声音?AV_MossFormer2_TSE_16K 结合画面中的人脸与口型信息,把目标说话人的声音从混合音轨里"抠"出来。传入视频目录即可批量处理(支持 .avi/.mp4/.mov/.webm):

myClearVoice = ClearVoice(task='target_speaker_extraction', model_names=['AV_MossFormer2_TSE_16K']) myClearVoice(input_path='samples/path_to_input_videos_tse', online_write=True, output_path='samples/path_to_output_videos_tse')

此外,项目还提供 Numpy 进 Numpy 出的接口(见 demo_Numpy2Numpy.py),方便把模型直接嵌进你自己的训练或推理管线。

效果好不好,让数字说话

光靠耳朵不够客观。SpeechScore 模块提供 18 种评测指标,最常用的四个:

  • PESQ:感知语音质量,约 0.5~4.5,越大越好——MossFormerGAN_SE_16K 在 DNS-Challenge-2020 上把 PESQ 从 1.58 拉到 3.57;
  • STOI:可懂度,0~1,越接近 1 越清楚;
  • DNSMOS:神经网络打的 MOS 分,1~5 分制;
  • SI-SDR:信号失真比(dB),越高代表分离与增强越干净。

评测代码同样一行启动:SpeechScore(['PESQ','STOI','DNSMOS','SISDR']),传入测试音频与参考音频即可。其中 DNSMOS、NISQA 这类"非侵入式"指标甚至不需要干净参考,直接给处理结果打分,相当方便。

进阶玩法与新手避坑指南

想让模型适配自己的数据?train/ 目录下有四类任务的完整训练脚本,配置集中在train/speech_enhancement/config/train/等目录,还附带自动合成带噪、带混响训练音频的数据生成脚本(train/data_generation/)。更硬核的是,目标说话人提取支持用参考语音、人脸口型、身体姿态乃至脑电信号(EEG)作为提取条件。

新手最常踩的坑有三个:

  • 非 WAV 格式报错:处理 MP3/AAC/FLAC 前先装 FFmpeg,纯 WAV 不需要;
  • 长音频卡顿或爆内存:建议先切成 30~60 秒片段,或用目录/列表批量处理(online_write=True);
  • 模型下载失败:首次运行需联网自动拉取预训练模型,网络不稳时可手动从 ModelScope 下载放到checkpoints目录。

你可能担心的 3 件事

① 不会写代码能用吗?能。复制上面的代码、改一下文件路径就行;demo_with_more_comments.py每步都有详细注释,照着读就能懂。

② 支持哪些系统和格式?Windows、macOS、Linux 都能跑;音频支持 wav、mp3、aac、flac、ogg、aiff 等十几种常见格式,视频支持 avi、mp4、mov、webm。

③ 效果真的靠谱吗?预训练模型出自阿里巴巴语音实验室团队,全部经过公开基准严格评测(上文指标就是证据);其中 FRCRN 去噪模型在 ModelScope 上已被调用超过 300 万次,口碑经得起检验。

现在就去试试:3 分钟体验 AI 语音处理

回到开头那个深夜剪播客的场景:如果你硬盘里也躺着"舍不得删又没法用"的录音,现在花 3 分钟就能给它第二次生命。装好clearvoice后跑一遍demo.py,用samples/里的示例音频对比"处理前 vs 处理后"的差别,你会回来收藏这篇文章的。

想第一时间获取新模型和使用教程?扫描下方二维码加入官方交流群,和开发者、同好一起聊语音增强与处理心得;如果你有更好的模型思路,也欢迎通过 train/ 框架贡献代码,让更多人用上更干净的声音。

【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/19 16:29:26

C/C++开发工具CLion v2022.3全新发布——支持C++ 20

CLion是一款专为开发C及C所设计的跨平台IDE。它是以IntelliJ为基础设计的,包含了许多智能功能来提高开发人员的生产力。这种强大的IDE帮助开发人员在Linux、OS X和Windows上来开发C/C,同时它还使用智能编辑器来提高代码质量、自动代码重构并且深度整合CM…

作者头像 李华
网站建设 2026/8/19 16:29:14

激励错位下的重复博弈:信息与契约设计如何驱动长期合作

1. 项目概述:当激励错位的代理反复相遇在现实世界的合作与博弈中,一个核心且无处不在的难题是:当参与各方的目标不完全一致,甚至存在冲突时,如何设计一套有效的规则,使得长期合作成为可能?这正是…

作者头像 李华
网站建设 2026/8/19 16:28:01

免费离线OCR软件Umi-OCR怎么用?从截图识别到PDF文字提取的完整实测

免费离线OCR软件Umi-OCR怎么用?从截图识别到PDF文字提取的完整实测 【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。…

作者头像 李华