如何快速上手RapidOCR:10分钟内跑通多语言文本识别
【免费下载链接】RapidOCR📄 Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR
截图里日文混着中文,复制进翻译软件却读不出来?RapidOCR 是一个多语言文本识别库:把 PaddleOCR 的模型转成 ONNX 格式,默认用 ONNX Runtime 推理,装完就能调,全程离线、免费。
📋 它到底能干什么(能力速览)
它不是那种"喂图给你一串文字"的黑盒,框、分数、词级位置都会给你,输出是结构化数据:
| 能力 | 一句话说清 | 谁会用 |
|---|---|---|
| 全文本检测 | 找出图里每一行文字,输出框的坐标 | 想从截图里抠出文字的任何人 |
| 多语言识别 | 一个参数切换模型,覆盖中日韩、阿拉伯文等十几种文字 | 处理商品页、字幕、海外内容的同学 |
| 词级框 | 传一个参数,拿到每行里每个词的位置 | 字幕对齐、版面精细分析 |
| 竖排与倒置文字 | 方向分类器自动转正再识别,不用手工处理 | 老文档、招牌、拍歪的名片 |
| 多引擎推理 | ONNX Runtime / OpenVINO / PaddlePaddle / PyTorch / TensorRT / MNN 六个后端 | 要往不同硬件上部署的人 |
🚀 10分钟跑起来(安装 → 首次调用)
安装就一行命令,不用 clone 仓库,不用自己配依赖:
pip install rapidocr onnxruntime下面这段就是最小可跑示例:创建引擎、把图喂进去、打印结果,再存一张标注图:
from rapidocr import RapidOCR engine = RapidOCR() result = engine("TEST.png") print(result) result.vis("result.jpg")首次调用会自动下载识别模型,之后就是纯离线。result里有三个字段:boxes(坐标)、txts(文字)、scores(置信度)。不想写代码也行,直接敲命令:
rapidocr -img TEST.png本节用的测试素材就是仓库测试集里最基础的那种,一行 TEST 文字:
🧪 拿真实素材试两把(场景实战)
场景1:日文图。默认走中英模型,纯日文把语言参数切一下就行:
rapidocr -img japan.jpg --lang_type japan日文、汉字、数字都能读出来,不用为日语单独找工具。
场景2:词级框。做字幕对齐时,你得知道"哪个字在哪个位置":
result = engine("japan.jpg", return_word_box=True) print(result.word_results)每行返回一组(词、置信度、框)三元组,可以直接叠加到画面上。
场景3:倒置文字。名片、单据拍反了很常见,方向分类器接住它:
result = engine("upside_down.jpg")use_cls默认开着,识别前会自动把图片转 180°,你不用手动翻。
🔍 拆开看看:RapidOCR内部长什么样(架构速览)
好奇的话点开三个目录就够了:
- 文本检测模块 — 负责找出图里的文字区域,输出检测框
- 文本识别模块 — 把框裁剪出来逐条识字,也产出词级框
- 推理引擎 — 六种推理后端的实现,det/cls/rec 可分别配置
🩺 效果打折扣?对号入座(调优与避坑)
- 文字漏检、一行被切成两框→ 多半是 box_thresh / text_score 阈值卡太严 → 调用时调大 box_thresh 或调低 text_score
- 纯日文图识别出乱码→ 多半是语言模型没切,默认是中英 ch → 换成
--lang_type japan - 倒置文字读出来是错的→ 多半是方向分类 use_cls 被关了 → 保持开启,cls 会自动转正
- CPU 上跑得快不上来→ 多半是引擎没选对 → 默认 onnxruntime 已针对 CPU 调过,Intel CPU 可换 openvino,NVIDIA 显卡换 tensorrt
模型是 ONNX 格式,CPU 就能离线跑。现在就执行pip install rapidocr onnxruntime,第一张图马上出结果。
【免费下载链接】RapidOCR📄 Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考