TL;DR:百度飞桨PP-OCRv6、智谱GLM-OCR、腾讯HyOCR-1.5、百度Unlimited-OCR、阿里Logics-Parsing-V3 这五个能本地跑的开源OCR模型,在规整文档上都能把字认全,但一遇到多栏、竖排、拍摄畸变、字段抽取就立刻分出高下。用4份刁钻样本实测:要还原表格选 Unlimited-OCR、HyOCR-1.5 或 Logics-Parsing-V3;要跨页长文档+目录大纲选 Logics-Parsing-V3;要读竖排古籍选 HyOCR-1.5;没有显卡选 PP-OCRv6;图快图省心选 GLM-OCR;但发票字段直接抽JSON几个都别信!
之前在 Python+AI数据分析实战 一文中我们使用了 GLM-OCR 进行了对图像的文字识别,那它究竟是不是一个好方案呢?本文我们带来一波不同模型在不同场景中的表现对比,来看看谁才是神兵利器。
正片,开始——
一、选手入场
首先,我们了解两个概念,OCR 与 VLM。
OCR (Optical Character Recognition,光学字符识别),简单说就是把图片中的文字转换成可编辑的文本 。例如,微信截图后可以提取文字,使用的就是 OCR 技术。特点是速度快、成本低。
VLM (Vision-Language Model,视觉语言模型),是基于 Transformer 架构大模型的分支,也就是在能力上更聚焦图片理解的多模态模型,也能够进行简单的推理。
| 维度 | 传统 OCR | 多模态 VLM |
|---|---|---|
| 文本转录 | 基础字符识别,印刷体准确率可达 95%+,手写/复杂布局降至 70%—80% | 多语言、数学公式、化学式转录,复杂场景 85%—90% |
| 结构处理 | 仅识别文本区域 | 解析表格、图表、图片位置与阅读顺序 |
| 语义理解 | 无 | 支持文档问答、检索式/生成式问答 |
| 输出格式 | 纯文本、JSON 坐标 | HTML、Markdown、LaTeX、DocTags |
| 多语言 | 每种语言需独立模型 | 统一模型覆盖上百种语言,低资源语言优势明显 |
| 硬件与延迟 | CPU 即可,成熟稳定 | 建议 GPU(8GB+ 显存) |
本次我们测评的是一批开源模型,大部分名称中随都带有 OCR,但其实除了 PP-OCRv6 都属于 VLM 这一类,只是对 OCR 能力做了特化训练。
- PP-OCRv6(百度飞桨 PaddleOCR,34.5M medium档):先用一个模型把每行文字框出来(检测),再用另一个模型逐行认字(识别)。它只负责认字,不理解版面、不懂栏与列、也不能对话。优点是极轻、CPU可跑。
- GLM-OCR(智谱AI,0.9B):一个很小的 VLM,通过 Ollama 运行。你像聊天一样把图片发给它、告诉它「识别全部文字」,它回你一段文字。轻量、快、提示词自由。
- HyOCR-1.5(腾讯混元 HunyuanOCR,1B):端到端OCR视觉大模型,逐页把文档解析成 markdown(标题层级)+ HTML表格 + LaTeX公式。
- Unlimited-OCR(百度,总 3B / 激活约 570M):文档解析专用VLM,可以一次吃进多页,输出自带版面标签(标题/正文/表格/图)并把表格转成HTML。
- Logics-Parsing-V3(阿里 Alibaba-DT,0.8B):在大模型中最小,主打跨页长文档结构化解析。其他 VLM 一次只看一页,它是用「不重叠滑动窗口」逐窗推进、把一个紧凑的结构state(开放标题栈+跨页未完结句)从上一窗带到下一窗,从而在超出单次上下文时仍能拼出连贯的文档树,还能输出文档级目录大纲(hierarchy)。输出是自定义DSL,再转成markdown/HTML。
考场环境:笔记本 i7-14700HX / RTX 4060 8G / DDR5 32G
二、仔细看题
1.超长表格:71页的《信用目录》扫描图
在政务部门工作的同学或许经常遇到,明明是表格,为什么不下发 EXCEL,甚至不是 WORD,甚至不是原生 PDF,给表格图片是要怎么处理啊!
那么,关于《全国公共信用信息基础目录(2026年版)》的说明(官方发布原为 PDF),用其扫描版作为第一道压力测试题,2 页的正文后跟着 69 页的表格,含合并单元格,请各位模型大展身手。
为了便于观察,我 vibe coding 了一个对比执行工作台。
就第一页来看,PP 和 GLM 都是原样识别,包括大标题的换行,而 HY 、UNL、LG 则将大标题识别为完成的一行,且 LG 还附带了内容类型标签,更便于进一步的解析处理。
还有一点值得注意,只有 HY 和 LG 忽略了右下角的「- 3 -」页码。
对各模型的前 2 页识别结果过滤换行符和标签,后逐字比对,UNL 险胜,只偏差 2 个空格。可见规整清晰的扫描稿对各个 AI 来说都是毫无压力的。
继续看最难的表格部分,只有 HY、UNL、LG 可解析保留原始表格版面。
其中,仅有 LG 正确识别了合并单元格影响下的整表版面,HY 和 UNL 都出现了错位。
71页总体识别而言,GLM 速度显著,仅耗时 8 分钟,且其中 2 分钟是 ollama 冷启动模型的耗时。但 GLM 在表格上的识别结果是难以进一步使用的,丢失了版面信息,即使提取了文字也无法解析还原正确的顺序。
本应是最轻量的 PP 居然耗时最久,推测是先检测后识别的管线在表格文本的位置检测上耗时过多。不得不吐槽,百度飞桨的模型都好难用…安装部署和后续解析,即使有 AI 帮助操作都很麻烦= 。=
而 LG 以长文跨页识别为卖点,实际表现相当不错,兼顾效率和质量。
2.老演员了:发票~发票
本题用例是 GPT-Image2 生成的 2 张电子发票和 2 张发票照片,其中一张手持的照片有轻微畸变。
经过长表格之战,LG 对区区单页的发票似乎也手拿把掐,难不成要直接宣布 LG 杀死比赛了?
经过抽查,GLM 漏字最多,对复杂排版的解析结果基本不可用。
HY 、UNL不相上下,但在 LG 面前也是略逊一筹了。
对于发票这种要固定抽取字段的场景,PP 的定位检测或许有奇效,且它对手持发票照片的抗畸变识别最全。
初步看来,发票字段抽取的稳妥路线是 Unlimited-OCR / Logics-Parsing-V3 的结构化 HTML(或 PP-OCRv6 的行)+ 下游规则 / LLM 进一步解析。
3.多栏混排:简历
本用例也是 G2 生成的模拟简历,简历内容的阅读顺序基本是从上往下,从左往右,偶尔穿插双栏、三栏混排,相对结构比前两个用例还是要简单一些。
PP 老问题,直出的结构不是给人类看的,还要进行复杂的二次处理。
GLM 对混排相对苦手,凑活能用。
UNL 比 GLM 略好,对有头像的简历还会带图片占位符,但不区分标题层级。
HY 和 LG 不仅识别标题,还会把多栏当做表格来处理。
4.你说这个谁懂啊:古籍
本用例是网上搜的古籍图片,特点:竖排、从右往左、繁体、木刻字形、夹双行小字,传统OCR的死穴,也最考验模型是否真「懂」中文阅读顺序。
本以为 LG 将拿下全场,到了从右往左的竖排古籍,LG 仍保持从左往右的阅读习惯,且错字多,直接翻车。
PP 虽然也是默认从左往右,但位置检测上是竖排的,且单字最准,或许还有办法逆转。
UNL 更是惨不忍睹,直接俺不识字。
GLM 和 HY 意外表现较好,两者相似度也是最接近的,但 GLM 的错字较多,本轮 HY 胜。
三、选型建议
上手难度排序(易→难):GLM-OCR < HyOCR-1.5 / Unlimited-OCR < PP-OCRv6 / Logics-Parsing-V3
- GLM-OCR:0.9B 显存占用小、速度最快,上手最容易,自由 prompt。坑:复杂排版不可靠,Ollama 服务会常驻显存,跑别的 GPU 模型前需先停用。
- Unlimited-OCR:Transformers + 本地权重文件 6.2GB,可配
image_size、批页数、prompt,上手中等。坑:8GB 显存吃紧,竖排识别不佳。 - HyOCR-1.5:Transformers + 本地权重文件 2.24GB,可配
--dpi / --prompt / --max-pages / --attention;逐页落盘可断点续跑、manifest 校验输入一致性,上手较难。坑:大图不降采样极慢,版本与后端坑多。 - Logics-Parsing-V3:0.8B、权重仅1.7GB,架构是 transformers 内建的 qwen3_5,官方推理脚本强依赖 vLLM 0.22.1(不支持原生 Windows),可配单页/跨页(
--longdoc --window)、像素上限、dpi,逐窗json缓存可断点续跑。上手中等偏难(要绕开 vLLM)。坑:跨页 longdoc 在 8GB 卡上显存贴近上限,本机无 flash-linear-attention 时回退 torch 实现。 - PP-OCRv6:
pip install paddleocr≥3.7(3.4 没有 v6);纯CPU可跑;Tiny/Small/Medium 三档可配;无提示词(固定管线)。看似上手容易,但环境用 AI 都配半天。坑:无阅读顺序/版面分析,表格/公式要换 PP-StructureV3 等管线。
其实每个模型安装部署和使用都有坑,直接按官方文档操作都不一定能一次性成功,遇到奇奇怪怪的 BUG 就让 Agent 处理。
实用性、全面性(强→弱):Logics-Parsing-V3 > HyOCR-1.5 / Unlimited-OCR > PP-OCRv6 / GLM-OCR
- 长文档、复杂表格首选 LG,且兼具占用小、速度快、准确高
- 新手体验选 GLM
参考资料
https://ollama.com/library/glm-ocr
https://github.com/baidu/Unlimited-OCR
https://modelscope.cn/collections/PaddlePaddle/PP-OCRv6
https://github.com/Tencent-Hunyuan/HunyuanOCR
https://modelscope.cn/models/Alibaba-DT/Logics-Parsing-V3
后记
AI 提质增效后却依然有加不完的班…一个月没自主学习了,这里是中秋躺了两天的咸鱼 Seon,我们下一篇见!~ 国庆节,又可以躺了呢 = v =
谢谢你阅读我的文章~如果有帮助的话点个赞、转发、收藏吧,关注我🌟不迷路