终极语音转文字解决方案:AMD Whisper Small ONNX-NPU模型性能测试与优化
【免费下载链接】whisper-small-onnx-npu项目地址: https://ai.gitcode.com/hf_mirrors/amd/whisper-small-onnx-npu
AMD Whisper Small ONNX-NPU是基于OpenAI Whisper Small模型优化的语音转文字解决方案,专为AMD NPU硬件加速设计。该项目通过ONNX格式导出模型并优化静态形状,实现高效的语音识别功能,为开发者和普通用户提供快速、准确的语音转文字体验。
核心功能与技术优势
基于OpenAI Whisper的优化实现
该模型基于openai/whisper-small基础模型构建,通过PyTorch的torch.onnx.export工具导出为ONNX格式,并针对seq_len参数设置静态形状,确保在NPU硬件上的高效运行。这种优化使得模型在保持识别准确性的同时,显著提升了处理速度。
NPU硬件加速支持
作为AMD专为NPU优化的语音模型,该解决方案充分利用AMD处理器的神经网络处理单元,实现语音数据的并行处理。相比传统CPU处理,NPU加速可降低延迟并提高吞吐量,特别适合实时语音转文字场景。
模型文件组成
项目包含以下核心文件:
- encoder_model.onnx:编码器模型,负责将语音信号转换为特征向量
- decoder_model.onnx:解码器模型,将特征向量转换为文本输出
- ggml-small-encoder-vitisai.rai:针对Vitis AI优化的模型文件,进一步提升NPU运行效率
快速开始指南
环境准备
- 确保您的AMD处理器支持NPU功能
- 安装必要的依赖库(参考AMD官方文档)
运行步骤
- 克隆项目仓库:
git clone https://link.gitcode.com/i/9e62d616b5552187b7d7c4087b6aeb13 - 参考官方演示代码运行模型:
# 示例代码路径参考 # https://github.com/amd/RyzenAI-SW/blob/main/demo/ASR/Whisper/run_whisper.py
性能优化建议
输入长度优化
由于模型采用静态seq_len设置,建议将输入语音片段长度控制在模型优化的序列长度范围内,避免因数据填充导致的性能损耗。
批处理策略
对多个语音文件进行批量处理时,合理设置批大小可充分利用NPU的并行计算能力,建议根据硬件配置调整批处理参数。
应用场景
- 实时语音转写:会议记录、直播字幕生成
- 语音助手:智能设备的语音命令识别
- 音频内容分析:播客、视频的文字化处理
许可证信息
本项目采用Apache-2.0许可证,详细信息参见项目根目录下的LICENSE文件。
Copyright (c) 2025, Advanced Micro Devices, Inc. All rights reserved.
【免费下载链接】whisper-small-onnx-npu项目地址: https://ai.gitcode.com/hf_mirrors/amd/whisper-small-onnx-npu
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考