news 2026/7/20 20:51:20

DIAMOND语音修复模型:从零开始构建的166.6M参数AI音频修复神器

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
DIAMOND语音修复模型:从零开始构建的166.6M参数AI音频修复神器

DIAMOND语音修复模型:从零开始构建的166.6M参数AI音频修复神器

【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0

DIAMOND是一款强大的AI语音修复模型,它能将受损的音频转化为接近录音室品质的44.1 kHz语音。作为一款序列到序列的生成式模型,DIAMOND采用自回归RQ-Transformer架构,通过神经音频编解码器令牌实现高质量的语音修复,为用户提供了简单而高效的音频修复解决方案。

🌟 DIAMOND的核心优势

🔹 双Transformer读取机制

DIAMOND创新性地采用了"时间Transformer"和"深度Transformer"的双Transformer架构。时间Transformer负责对帧序列进行建模,而紧凑的深度Transformer则处理每个帧内的9个RVQ码本。这种设计恢复了RVQ的因果链,并优化了输出投影,相比早期模型通过并行头从单个帧向量中读取所有九个码本的方式,效率和效果都有显著提升。

🔹 从零开始训练的166.6M参数模型

DIAMOND不依赖任何预训练的语音主干网络,完全从零开始训练,拥有约166.6M的可训练参数。令人印象深刻的是,发布的检查点仅需63 GPU小时的训练时间,展现了模型高效的训练特性。

🔹 44.1 kHz高保真输出

借助冻结的DAC解码器,DIAMOND能够合成全频带音频,8 kHz以上的嘶嘶声和"空气感"不是简单地通过,而是重新生成,确保了输出音频的高保真度和自然度。

🔹 内容测量而非假设

作为生成式修复器,DIAMOND不仅关注音频的清晰度,还注重内容的准确性。除了DNSMOS感知质量评估外,还使用CER(字符错误率)相对于真实转录本进行评估,确保修复后的语音内容准确无误。

🎧 聆听修复效果

DIAMOND能够将严重受损的语音修复到44.1 kHz的高品质。每个音频片段的DNSMOS-P.835 OVRL评分都提升了整整一个点以上,即使不使用耳机也能明显听出差异。项目提供了多个修复前后的音频示例,展示了DIAMOND的强大修复能力:

  • 示例1:原始受损音频 samples/example1_degraded.wav,修复后音频 samples/example1_restored.wav,DNSMOS OVRL评分从2.16提升至3.50(+1.34)
  • 示例2:原始受损音频 samples/example2_degraded.wav,修复后音频 samples/example2_restored.wav,DNSMOS OVRL评分从2.83提升至3.59(+0.76)
  • 示例3:原始受损音频 samples/example3_degraded.wav,修复后音频 samples/example3_restored.wav,DNSMOS OVRL评分从2.56提升至3.65(+1.10)
  • 示例4:原始受损音频 samples/example4_degraded.wav,修复后音频 samples/example4_restored.wav,DNSMOS OVRL评分从3.32提升至3.89(+0.57)

📊 模型详细信息

架构组成

  • 编码器:双向Transformer,无下采样 - 20层,512维,8个注意力头(63.9M参数)
  • 解码器/时间Transformer:因果自注意力 + 交叉注意力 - 20层,512维,8个注意力头(88.7M参数)
  • 码本读取/深度Transformer:帧内9个RVQ码的局部自回归 - 4层,384维,6个注意力头(14.0M参数)

技术参数

  • 可训练参数:≈ 166.6M(DAC编解码器约74M,在运行时下载且冻结)
  • 音频编解码器:Descript Audio Codec - 44.1 kHz,9码本RVQ,86帧/秒
  • 输入/输出采样率:任何输入,内部重采样至24 kHz → 44,100 Hz输出
  • 训练数据:681.5小时的工作室语音,约2.5k speakers,28%原生宽带
  • 支持语言:英语
  • 许可证:Apache 2.0

🏆 性能基准测试

在750个真实受损录音上进行的测试显示,DIAMOND在感知质量方面表现优异。DNSMOS-P.835用于评估感知质量,CER(字符错误率)用于评估内容保留。测试结果显示,DIAMOND在六个模型中排名第二,超越了RE-USE等模型,尽管这些模型的训练数据量大约是DIAMOND的四倍。

DIAMOND改善了约88%的音频片段(平均ΔOVRL +0.255),证明了其在语音修复任务上的强大能力。作为自回归系统,DIAMOND在CER指标上表现出竞争力,与另一款自回归系统UniSE达到了相同的平均CER(0.131)。

🚀 如何开始使用DIAMOND

要开始使用DIAMOND语音修复模型,首先需要克隆项目仓库:

git clone https://gitcode.com/hf_mirrors/nineninesix/diamond-1.0

项目提供了详细的技术报告 TECH_REPORT.pdf,其中包含了模型的详细架构和实现细节。模型配置文件 diamond.json 定义了编码器、解码器和其他关键组件的参数设置,可帮助用户更好地理解和使用模型。

💡 适用场景与注意事项

理想应用场景

DIAMOND特别适合离线修复和数据集清洗任务,能够将大量受损录音(播客、采访、档案和经过有损编解码器处理的用户生成音频)转换为足够清晰的素材,用于进一步的训练或应用。

使用注意事项

  • CER尾部效应:作为自回归解码器,DIAMOND在处理困难片段时偶尔会出现单词模糊。推理保护措施(分块解码、重复惩罚)可以减轻这一问题,但在内容保真度至关重要时,建议检查转录本。
  • 非实时解码:解码是串行的,不是实时的。每帧处理一次,每秒音频86帧,加上深度处理,因此DIAMOND适用于离线修复,而非实时过滤。
  • 英语优化:训练数据为英语,其他语言未经测试。
  • 生成而非过滤:编解码器截止频率以上的内容是根据上下文生成的,是合理的推测而非真实恢复。因此,不要将输出视为所说内容的法医证据。

负责任地使用:修复后的语音是合成语音。不要将其呈现为未经修改的录音,也不要用它来伪造或错误归因某人的言论。

🙏 致谢

DIAMOND基于Descript Audio Codec构建,使用了冻结的令牌空间。训练数据来自LibriTTS-R、Hi-Fi TTS和VCTK等语料库。评估使用了DNSMOS P.835和faster-whisper工具。

📄 许可证

DIAMOND模型及其权重根据Apache License 2.0发布。运行时下载的冻结Descript Audio Codec带有其自己的许可证(MIT)。

【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/20 20:50:48

如何让老款Mac焕发新生:OpenCore Legacy Patcher详细使用指南

如何让老款Mac焕发新生:OpenCore Legacy Patcher详细使用指南 【免费下载链接】OpenCore-Legacy-Patcher Experience macOS just like before 项目地址: https://gitcode.com/GitHub_Trending/op/OpenCore-Legacy-Patcher 你是否有一台性能依然不错的老款Mac…

作者头像 李华
网站建设 2026/7/20 20:50:00

ComfyUI-WanVideoWrapper:如何用模块化架构解锁专业级AI视频创作

ComfyUI-WanVideoWrapper:如何用模块化架构解锁专业级AI视频创作 【免费下载链接】ComfyUI-WanVideoWrapper 项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper 在AI视频生成技术快速迭代的今天,如何在熟悉的ComfyUI环…

作者头像 李华
网站建设 2026/7/20 20:48:39

线性代数破壁指南:从课本定理 Ax=b 到 Python 实战模型

线性代数破壁指南:从课本定理 A x = b Ax=b Ax=b 到 Python 实战模型 前言 很多科班出身的程序员,大学时都学过《线性代数》。但我们通常面临一个尴尬的局面:课本上全是艰涩的矩阵符号和定理推导,而工作中遇到的数据分析、AI 预测、电路仿真,又处处离不开矩阵运算。 今…

作者头像 李华
网站建设 2026/7/20 20:48:02

手写一遍 Multi-Agent,我才看清框架到底藏了什么

用过 [LangChain]的人很多,能讲清 agent.run() 内部在做什么的人很少。 我也是前者。所以这次把框架放一边,从零手写了一个 Multi-Agent 客服系统——能查订单、答 FAQ、处理投诉,多个 Agent 协作。 不是为了取代框架,是想搞懂。…

作者头像 李华
网站建设 2026/7/20 20:48:01

如何快速掌握智能资源下载工具:新手入门完整教程

如何快速掌握智能资源下载工具:新手入门完整教程 【免费下载链接】res-downloader 视频号、小程序、抖音、快手、小红书、直播流、m3u8、酷狗、QQ音乐等常见网络资源下载! 项目地址: https://gitcode.com/GitHub_Trending/re/res-downloader 还在为视频号、抖…

作者头像 李华