news 2026/9/7 5:52:54

FunASR 离线语音转写:Windows 本地部署 64 路并发实操手册

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
FunASR 离线语音转写:Windows 本地部署 64 路并发实操手册

FunASR 离线语音转写:Windows 本地部署 64 路并发实操手册

【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR

FunASR 是达摩院语音实验室推出的开源语音识别工具包,覆盖语音转写、语音活动检测(VAD)、标点恢复(PUNC)等全链路能力。在 Windows 上做本地部署,即可跑通完全离线的语音转写:音频不出本机、无需 GPU,16 核 CPU 能支撑 64 路并发。

上图为 FunASR 的整体布局:模型库、训练推理库、运行时与服务层四层,Windows 用户日常打交道的主要是后两层。

没有显卡能不能跑,数据会不会出本地

部署 ASR 服务前,大多数人最关心两个问题:要不要显卡、音频数据去哪里。

  • 不需要 GPU:Windows SDK 2.0 支持中/英文离线文件转写,纯 CPU 即可运行,适合企业本地化部署
  • 数据留在本地:语音数据完全在本机处理,不上传云端,适合金融客服、医疗记录、司法审讯等隐私敏感场景
  • 性能有具体数字:16 核 CPU 服务器支持 64 路并发请求,实时率(RTF)低至 0.0076
  • 输入格式省心:集成 FFmpeg,wav、mp3、mp4 等常见音视频可直接转写,无需预先转码

Windows 离线语音识别部署前要准备什么

硬件配置怎么选

档位CPU 核心内存支持并发适用场景
基础4 核8GB32 路个人 / 小团队
标准16 核32GB64 路部门级应用
企业64 核128GB200 路大规模集群

系统与软件要求

  • 操作系统:Windows 10/11 专业版(64 位)
  • 运行时:.NET Framework 4.8 或更高版本
  • 容器:Docker Desktop for Windows,需启用 WSL2 后端;家庭版用户需先开启 WSL2,步骤可查微软官方文档

离线转写服务怎么启动

部署流程是「拉取项目 → 一键脚本 → 验证」三步,全程只需按脚本提示选项。

1. 拉取项目并进入部署目录

git clone https://gitcode.com/GitHub_Trending/fun/FunASR.git cd FunASR/runtime/deploy_tools

2. 执行一键部署脚本

双击运行funasr-runtime-deploy-offline-cpu-zh.bat(同目录另有 shell 版funasr-runtime-deploy-offline-cpu-zh.sh,适合 WSL / Git Bash 环境),按提示完成配置:

  1. 模型类型:1 = 基础转写,2 = 带时间戳转写,3 = 热词增强
  2. 服务端口:默认 10095,可自定义
  3. 工作目录:建议选 D 盘等非系统盘,避免权限问题

如果提示docker: command not found,先安装 Docker Desktop 并重启电脑。

服务启动后,每条音频会走完整离线转写链路:语音端点检测 → 声学模型解码 → 标点预测 → 逆文本规范化(ITN),输出带标点、数字已规范化的文本。

3. 验证服务状态

  • 浏览器方式:打开http://localhost:10095,能看到服务状态页即部署成功
  • 命令行方式:
curl http://localhost:10095/health

预期返回{"status":"healthy","version":"2.0"}

转写任务怎么调用:单文件、批量与 Web 界面

单文件转写

仓库在runtime/python/websocket目录提供了 Python WebSocket 客户端:

python funasr_wss_client.py --host "127.0.0.1" --port 10095 --mode offline --audio_in "C:/meeting_recording.wav" --use_itn 1

常用参数:

  • --audio_in:支持 wav/mp3/mp4 等格式,也支持网络音频 URL
  • --use_itn 1:开启数字规范化,例如 "123" 输出为「一百二十三」
  • --hotword:指定热词文件路径,提升专业术语识别准确率

批量文件处理

先建一个wav.scp文件,每行「标识 路径」,例如会议记录1 C:/audio/meeting1.mp3。转写时把--audio_in指向该 scp 文件,并追加--output_dir "C:/transcripts",结果会统一落到指定输出目录。

免代码的 Web 界面

在浏览器打开runtime/html5/static/index.html,即可上传文件转写或实时录音转文字,适合不想写代码的场景。

生产化调优:并发、长音频与日常运维

线程与内存怎么调

  • 解码线程数 ≈ CPU 核心数 ÷ 2,IO 线程数 ≈ 核心数 ÷ 4。例如 16 核机器可设为 8/4:funasr-runtime-deploy-offline-cpu-zh.bat update --decode_thread_num 8 --io_thread_num 4
  • 超过 1 小时的超长音频,启用分片处理:... update --max_single_audio_length 3600
  • 按行业换用专用模型:医疗damo/speech_paraformer-large_asr_nat-zh-cn-16k-medical-vocab5000-pytorch,金融damo/speech_paraformer-large_asr_nat-zh-cn-16k-financial-vocab8404-pytorch,通过update --asr_model <模型名>替换

服务管理命令与日志

操作命令
启动funasr-runtime-deploy-offline-cpu-zh.bat start
停止funasr-runtime-deploy-offline-cpu-zh.bat stop
重启funasr-runtime-deploy-offline-cpu-zh.bat restart
状态funasr-runtime-deploy-offline-cpu-zh.bat status

服务日志在workspace/logs目录;性能方面可用 Windows 性能监视器跟踪 CPU 与内存占用。更细粒度的部署参数,可查 离线部署进阶文档。

三个高频问题

  • 端口被占用(容器闪退、日志报 "port is already allocated"):用netstat -ano | findstr :10095找到占用进程,再执行taskkill /PID <进程ID> /F强制结束
  • 转写准确率不理想:到 模型列表 换更新的模型;在workspace/hotwords.txt中按「热词 权重」逐行添加热词;用 Audacity 等工具把音频统一为 16kHz 采样率
  • 防火墙拦截:执行netsh advfirewall firewall add rule name="FunASR" dir=in action=allow protocol=TCP localport=10095放行入站端口

这套本地方案目前主要落在四类需求上:金融客服质检、医疗语音病历、司法审讯转写、教育课堂字幕。后续版本计划补充多语言混合转写、GPU 加速、实时自定义词典更新,以及更丰富的 API 与 SDK。

【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 5:51:01

AE/PR插件部署与优化指南:提升后期工作流效率

这是一篇适用于 After Effects 和 Premiere 的后期插件选型与部署参考。这类插件通常不是单个特效文件&#xff0c;而是把转场、调色、字幕动画、文字排版、素材管理等功能打包成一整套工作流工具。如果你经常在这两个软件之间交替干活&#xff0c;又不想每次都用原生节点去拼效…

作者头像 李华
网站建设 2026/9/7 5:50:10

After Effects圆角动画效率低?RoundPro插件从参数到工作流全面解析

在一张 App 卡片上浮动效里&#xff0c;卡片从底部滑入&#xff0c;圆角从 28 像素过渡到 12 像素。这个动效在设计稿里只是拖一下圆角参数&#xff0c;但到了 After Effects 中&#xff0c;你可能会先愣一下&#xff1a;我到底该在哪里 K 这个关键帧&#xff1f;AE 并不是没有…

作者头像 李华
网站建设 2026/9/7 5:49:56

N32G435电机控制开发实战:SDK搭建、外设配置与调试坑点详解

简介&#xff1a;N32G435xx系列SDK开发资料是一套面向嵌入式开发者的完整MCU资源包&#xff0c;围绕国民技术N32G435系列芯片整理而成。该系列基于32位ARM Cortex-M4内核&#xff0c;最高工作主频108MHz&#xff0c;支持浮点运算和DSP指令&#xff0c;集成128KB嵌入式加密Flash…

作者头像 李华
网站建设 2026/9/7 5:49:00

CPU如何执行C语言?从编译到机器码的完整链路解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 5:46:02

OpenAI Astra深度解析:摄像头点云与实时交互如何重塑AI助手

过去这一周&#xff0c;AI 圈子里最热闹的话题就是 OpenAI 的 Astra 发布。我翻了翻朋友圈、技术社区和几个常年争论不休的微信群&#xff0c;发现这次的风向出奇一致——几乎没人挑出什么大毛病。圈内朋友 KIM 的一句话我印象很深&#xff0c;他说自己到现在为止还没看到一条真…

作者头像 李华