Umi-OCR PDF 文字识别完整教程:五步把扫描件变成可搜索文本,免费离线,解压即用
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
同事发来的合同 PDF,Ctrl+F 一按没任何结果;自己扫的一摞发票,金额还得一个个敲进表格;图书馆翻拍的书页,想把要点复制进笔记。这三件事看着不同,其实是同一件事:页面上是图片,不是文字,电脑只看得见像素。你需要的是 PDF 文字识别——用 OCR(光学字符识别,就是让电脑从图片里"读"出文字)把笔画还原成真正的文本。Umi-OCR 是一款免费、开源、离线的 OCR 工具,解压压缩包就能用,不安装、不注册、不联网。
扫描件批量转文字的最短路径
- 解压并启动。拿到
.7z压缩包,解压后双击Umi-OCR.exe,窗口打开,界面语言会自动跟随你的系统。 - 打开"批量 OCR"标签页,拖图试试。jpg、png、webp 等格式都行,左侧列表会逐个列出文件名。
- 点击"开始任务"。进度条显示当前文件和耗时,右侧"记录"面板实时输出识别出的文字。
- 想留档就选保存格式。在右侧"设置"里选 txt、jsonl、md、csv(Excel) 等格式,任务结束后输出目录里自动生成文件。
- 拿到的是扫描版 PDF?切到"文档识别"标签页把 PDF 拖进去,任务结束后得到的是一份"双层可搜索 PDF"——既保留原版面,又多了一层可以搜索复制的文本。
场景化方案:识别过程中 4 个常见问题,逐个解决
扫描版 PDF"只能看不能搜",怎么补上文字层?
扫描件整页是图片,没有文字层,搜索、复制全都失灵。
切到"文档识别"标签页,把 PDF 拖进去;页面设置里可以选择对扫描件做识别还是直接提取原有文本,输出记得勾上双层可搜索 PDF。
验证很简单:打开输出文件,Ctrl+F 搜一句原文里的短语,能定位、能高亮,就成了。
水印、页眉、页码混进识别结果
图片角落的水印会被原样抄进文本,后期清理比识别本身还费时。
从"批量 OCR"右侧设置进入忽略区域,在预览图上按住右键画矩形框,把水印、页眉位置框进去。框画大一点,完全盖住它可能出现的所有位置。
先抽一两页试跑,框内的文字从结果里消失、正文完整保留,再开始整批任务。
多栏、代码截图识别出来顺序一团乱
多栏报纸杂志、代码缩进,直接识别会串栏、丢缩进,读起来像乱码。
在文本后处理设置里选择排版解析方案:多栏版面选"多栏-按自然段换行",代码截图选"单栏-保留缩进",想把所有句子强制合并成一行,还有"无换行"可用。
对照原图逐栏检查识别文本,换行和缩进与原文一致即可。
屏幕上的截图想抓字,不想先存图
截图已经在剪贴板里了,先存盘再识别嫌麻烦。
打开"截图 OCR"标签页,按截图快捷键直接划选识别,也可以把别处复制的图片直接粘贴进窗口;左侧预览区能用鼠标划选文字直接复制。
划选结束,文字就出现在右侧记录列表里,右键记录选"复制",粘进文档就能用。
效率进阶与自动化:让批量 OCR 跑得更快
- 善用记录列表快捷键。右键记录,复制(Ctrl+C)、全选(Ctrl+A)、选中全部记录都在,不用再拖鼠标。
- 长图识别乱序?先查"限制图像边长"。在页面设置→文字识别里把数值调高(例如从 1920 提到 2880);2880 足够,再高只会引入噪声、拖慢速度。
- 想接进自己的自动化流程。程序内置命令行和 HTTP 接口,比如一行 ⚡:
umi-ocr --screenshot --output result.txt识别当前屏幕并把结果写入文件,完整参数见 docs/README_CLI.md 和 docs/http/README.md。
常见问题:新手最常问的几个
Q:归档、编辑,分别选什么格式?
A:归档选双层可搜索 PDF,版面保留、可全文搜索;纯文本编辑选 TXT;给数据分析用就选 JSONL 或 CSV。
Q:图片分辨率越高,识别越准吗?
A:不一定。过度放大的图片只会增加噪声、拖慢速度。优先保证原图清晰;长图识别乱序多半是撞到了"限制图像边长",调高数值即可。
Q:日文竖排文字、竖排古籍怎么识别?
A:先确认当前 OCR 引擎支持竖排,再在排版解析里选对应方案——所有方案都能自动处理横排和竖排版面。
Q:界面截屏闪烁、UI 错位?
A:到"全局设置"→"界面和外观"→"渲染器"里切换渲染方案,或关闭硬件加速,多数情况能解决。
Q:几百张图片一批,怎么放心跑?
A:先抽一两页试跑,确认排版方案和忽略区域覆盖无误再整批开跑;批处理支持勾选任务完成后自动关机/待机,睡前挂机,第二天收结果。
从一张图拖进去,到整批扫描转文字;从框掉水印,到生成双层可搜索 PDF,Umi-OCR 把 PDF 文字识别的完整链路装进了一个解压即用的绿色工具里。用顺手之后,还可以去二维码标签页试试扫码与生成,或在 CHANGE_LOG.md 里看看每个版本修了什么、加了什么。下次再遇到"只能看不能搜"的 PDF,拖进去就行,不用一个字一个字地敲了。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考