Dolphin模型选型指南:base、small、medium、large怎么选最适合你?
【免费下载链接】DolphinDolphin is a multilingual, multitask ASR model jointly trained by DataoceanAI and Tsinghua University.项目地址: https://gitcode.com/gh_mirrors/dolphin22/Dolphin
Dolphin 是由 DataoceanAI 与清华大学联合训练的开源多语言多任务ASR语音识别模型,支持 40 种东方语言与 22 种中文方言,可同时完成语音识别、VAD 端点检测、语音分段和语种识别。面对Dolphin模型选型这个新手常遇到的问题,本指南将用最简单的方式讲清 base、small、medium、large 四个尺寸的区别,帮你快速找到最适合自己的那一款。
为什么 Dolphin 值得关注?🤔
Dolphin 采用 CTC-Attention 联合架构,编码器基于 E-Branchformer,解码器为标准 Transformer,训练数据超过 21 万小时。它沿用了 Whisper 与 OWSM 的创新思路,并做了针对性改进:引入两级语言标记体系(语言 + 区域),让模型能更精细地处理不同地区的中文方言和东方语言。
上图展示了 Dolphin 的多任务数据格式:从 SOS 起始符出发,依次包含语言(LANGUAGE)、区域(REGION)、转录(TRANSCRIBE)标记,输出既支持带时间戳的文本,也支持纯文本转录,这也是它能同时做识别、分段、打时间戳的原因。
Dolphin模型选型核心:四个尺寸的完整对比
官方规划了 4 个规格的模型,参数规模从 0.1B 到 1.7B 不等:
| 模型 | 参数量 | 当前是否开放 | 定位 |
|---|---|---|---|
| base | 0.1 B | ✅ 已开放 | 轻量入门 |
| small | 0.4 B | ✅ 已开放 | 均衡主力(默认) |
| medium | 0.9 B | ⏳ 规划中 | 高精度 |
| large | 1.7 B | ⏳ 规划中 | 旗舰级 |
注意:目前公开可用的主要是 base 和 small 及其衍生版本,medium、large 尚未开放,选型时请优先考虑现有模型。
base:轻量部署的最佳起点
base(0.1B)适合谁?追求低延迟、低资源消耗的开发者。如果你只是想在 CPU 上快速验证效果,或者部署到资源受限的边缘设备,base 是最省心的选择。它体积小、加载快,日常短语音转写完全够用。
small:官方默认的均衡主力
small(0.4B)是官方 CLI 工具的默认模型,也是绝大多数用户的首选。它在准确率与速度之间取得了最佳平衡,无需指定--model参数即可直接使用。无论你是个人开发者还是中小型项目,从 small 入手基本不会出错。
medium 与 large:等待开放的旗舰精度
medium(0.9B)和 large(1.7B)代表了更高的识别精度上限,适合对准确率有极致要求的场景(如专业字幕、会议纪要),但目前尚未开放下载,可以先关注官方更新,届时再迁移升级。
中文方言场景:别忘了 .cn 家族
如果你的语音数据以中文为主,选型时还应关注专门的中文方言系列(dolphin/model_registry.py中定义了全部可用模型):
| 模型名 | 特点 | 适用场景 |
|---|---|---|
| base.cn | 中文方言增强 | 中文为主、兼顾方言 |
| base.cn.streaming | 中文流式识别 | 实时字幕、直播转写 |
| small.cn | 中文方言均衡版 | 中文高精度场景 |
| small.cn.streaming | 中文流式均衡版 | 实时会议、客服质检 |
| small.cn.prompt | 支持提示词热词 | 热词纠错、专业术语 |
Dolphin 共支持 22 种中文方言区域码,如zh-SICHUAN(四川话)、zh-SHANGHAI(上海话)、zh-MINNAN(闽南语)等,完整清单见 languages.md。
按场景快速决策:一张表搞定选型
| 你的需求 | 推荐模型 | 理由 |
|---|---|---|
| 首次体验、CPU 环境 | base | 加载快、够轻量 |
| 通用中英混转写 | small | 官方默认,均衡 |
| 实时字幕/直播 | base.cn.streaming / small.cn.streaming | 流式低延迟 |
| 中文方言重度场景 | small.cn | 中文专项增强 |
| 人名、专业词纠错 | small.cn.prompt | 热词提示词加持 |
五分钟快速上手:安装与使用
Dolphin 使用非常简单,先安装 FFmpeg 并执行pip install -U dataoceanai-dolphin,随后一行命令即可完成转写:
# 默认使用 small 模型 dolphin audio.wav # 指定中文方言模型 dolphin audio.wav --model small.cn --lang_sym "zh" --region_sym "CN" # 流式模型示例 dolphin audio.wav --model small.cn.streamingPython 调用同样直观,核心入口是 dolphin/transcribe.py 中的load_model与transcribe:
import dolphin from dolphin import transcribe model = dolphin.load_model('small.cn', device="cuda") result = transcribe(model, 'audio.wav', lang_sym="zh") print(result.text)模型首次使用时会被自动下载并缓存在~/.cache/dolphin/目录,下载后本地运行不依赖网络。
总结
Dolphin 模型的选型并不复杂:入门选 base,通用选 small,中文方言选 .cn 系列,实时场景选 streaming,热词纠错选 prompt。medium 和 large 虽未开放,但 Dolphin 的模型注册表 dolphin/model_registry.py 已预留扩展位,未来升级路径清晰。现在就用pip install -U dataoceanai-dolphin安装,从 base 或 small 开始你的第一条语音转写吧!🎉
【免费下载链接】DolphinDolphin is a multilingual, multitask ASR model jointly trained by DataoceanAI and Tsinghua University.项目地址: https://gitcode.com/gh_mirrors/dolphin22/Dolphin
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考