免费离线OCR怎么用?3步跑通截图、批量、PDF文档识别
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
先讲一件我上周干过的蠢事。同事发来一份扫描版合同,我想引用其中一句条款,全选、复制——弹窗冷冷地提示"无法从此PDF复制文字"。我只好打开在线识别网站,结果文件超了大小限制、免费额度用完,更要命的是,这份敏感合同得先上传到别人的服务器。最后我装了Umi-OCR,一款免费、开源、完全离线的OCR文字识别软件,三分钟解决了这个痛点:图片和PDF全程留在本地硬盘,识别多少张、多大、多快,全由自己说了算。这篇指南就按我踩过的路重走一遍,你照着做就能立刻上手。
一、离线OCR到底赢在哪?一次对比说清楚
先别急着下载,花三十秒搞懂这个选择值不值。
在线OCR的典型流程是:上传图片 → 排队等待 → 限量识别 → 下载结果,中间还夹着"文件超限""免费次数用完"和"数据泄露"三个隐藏代价。而 Umi-OCR 把OCR引擎整个搬进了你的电脑,本地运行、本地计算,给你三个实打实的好处:
- 不限量:识别多少张都由你说了算,深夜挂机跑几百张图也不会被限流。
- 零泄露:图片和文档不离开硬盘,合同、论文、身份证件随便丢进去。
- 免安装:绿色软件,解压即用,连注册账号和联网激活都省了。
一句话总结它的定位:给Windows和Linux用户的一把"本地文字剪刀",剪哪里、剪多少,全凭你。下面我们正式上路。
二、从下载到启动:全程只要3个动作
Umi-OCR 不需要安装,这是它最舒服的一点。拿到压缩包后,你只需要做三件事:
- 下载:从项目发布页获取
.7z压缩包或.7z.exe自解压包。如果电脑没装压缩软件,直接选自解压包,双击就能解开。 - 解压:解压到任意目录,比如
D:/Tools/Umi-OCR。这里有个小提醒——路径里别带中文和空格,可以减少一些莫名其妙的兼容问题。 - 启动:Windows 双击
Umi-OCR.exe,Linux 运行umi-ocr.sh。
第一次启动时,软件会自动读取你的系统语言,把界面切成对应语言。程序主体由多个标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置,就像浏览器的标签栏,想用哪个点哪个,右上角还能锁定标签防止误关。
还有一个容易被忽略的细节:启动前把软件目录加入杀毒软件白名单。因为内置了本地OCR引擎和运行库,部分杀软会误报,加个白名单能省去后续"为什么闪退"的烦恼。
三、截图OCR:屏幕上看见的字,1秒变可复制文本
日常最高频的场景,是看到一段文字想立刻复制。打开"截图OCR"标签页,按下快捷键唤起截图框,划出目标区域,识别结果立刻出现在右侧记录栏里。
看这张图:左侧是截图预览,右侧是识别记录,识别完直接划选复制,不用再经过任何中转。
几个很实用的小习惯,试过就回不去:
- 不用截图也能识别:在聊天窗口复制一张图片,回到 Umi-OCR 直接粘贴,它照样帮你识别。
- 结果能二次编辑:右侧记录栏里的文字可以直接改错,多条记录一起划选复制,识别完顺手就能整理成想要的格式。
- 竖排文字也不怕:排版解析会自动处理横排和竖排(从右到左)的文本,只要OCR引擎本身支持竖排即可。
四、批量OCR:几百张图一起扔进去,顺手干掉水印
截图识别只是开胃菜,真正体现效率的是"批量OCR"。遇到几十上百张截图、扫描件、相册照片,一张张截屏就太亏了。切到"批量OCR"标签页,把图片直接拖进窗口,支持jpg、png、webp、bmp、tif、tiff等常见格式,一次拖几百张也没有数量上限。
注意看右侧:每张图片的耗时、置信度和识别结果逐条列出,任务跑完可以按需导出。
点下"开始任务",右侧会逐张显示耗时、置信度和结果。任务跑完后,能按需输出成txt、jsonl、md、csv(Excel可直接打开)四种格式。对于挂机场景,它还支持任务完成后自动关机或待机——睡前扔进去几百张图,醒来直接拿结果。v2.1.2 起还支持暂停任务,只要软件不退出,待机/休眠后可以接着跑。
这里重点讲一个高频痛点解法:忽略区域。批量图片角落的水印、LOGO、页眉页脚,每次都会混进识别结果里。在批量识别页右侧设置里进入忽略区域编辑器,按住右键在图片上绘制多个矩形框,把水印可能出现的位置全部框住,识别时这些区域内的文字就会被自动排除。
但有一个必须记住的机制:只有完全处于矩形框内部的整个文本块才会被忽略,而不是单个字符。所以画框时宁可大一点,把水印所有可能出现的位置都包住,否则漏框一次,结果里就混进一行杂音。
五、文档识别:把扫描版PDF变成可搜索的文本
如果说前面是热身,文档识别就是压轴功能。它支持pdf、xps、epub、mobi、fb2、cbz六种格式,扫描版PDF是最典型的应用场景。
底层逻辑可以概括为三步:解析 → 识别 → 重组。PDF先被拆开,区分出"本来就有的文本层"和"需要OCR的扫描图片层";扫描图片交给本地OCR引擎逐页识别;最后按阅读顺序重新拼装输出。操作上有两个亮点值得展开:
- 双层可搜索PDF:对扫描版PDF做OCR后,输出"底层是原图、上层是透明文字"的双层PDF。外观跟原扫描件一模一样,但里面的文字可以搜索、复制、划线。给公司做历史合同归档、给学校做论文数字化,这个功能能直接顶上去。
- 灵活的提取模式:Umi-OCR会优先尝试提取PDF自带的文本层(速度快、零识别误差),只有遇到纯扫描页才自动切换OCR。你也可以主动选择整页强制OCR,或反过来只提取原文本。v2.1.2 起还能输出单层纯文本PDF,想要体积小、好编辑的文件就选它。
文档识别同样支持忽略区域(可按页码范围设置),用来排除扫描件的页眉页脚,也能设置任务完成后的自动关机。手头有一堆扫描版书要转成可搜索存档的话,这个标签页能省下大量人工。
六、新手最容易搞砸的4件事,一次性说清
把最常见的报错集中成一份清单,遇到问题直接对号入座:
- 忽略区域画了却没效果?检查矩形框是否够大——只有整个文本块完全在框内才会被忽略;再确认是否保存了忽略区域配置。
- 长图识别结果缺胳膊少腿?去"文字识别"设置里调高限制图像边长,而不是盲目放大原图——过度放大会增加噪声,反而降低准确率。
- 截图时界面闪烁、错位?这是显卡渲染兼容问题。去"全局设置 → 界面和外观 → 渲染器",切换渲染方案或直接关闭硬件加速,通常能解决。
- 命令行指令没反应?Umi-OCR 依赖本地HTTP服务进行进程间通信,请确认全局设置里HTTP服务已开启(默认开启,且仅监听本地环回,不经过物理网卡,数据不会外泄)。
遇到界面闪烁或语言不对,答案都在这一页:渲染器开关、界面语言、主题切换,全在这里解决。
七、进阶玩法:命令行和HTTP接口,把OCR塞进你的工作流
对普通用户来说,图形界面已经够用;但如果你想把它嵌入自己的工作流,Umi-OCR 还提供两条"程序化通道"。
命令行模式,入口就是主程序本身。几个常用姿势:
# 截屏识别,结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片,结果输出到文件 umi-ocr --path "D:/扫描件.png" --output result.txt # 识别整个文件夹(含子目录) umi-ocr --path "D:/scans" "--> " all_result.txt # 生成二维码 umi-ocr --qrcode_create "你好,Umi-OCR" "D:/qrcode.png" 256配合快捷键工具(如 HotkeysCMD),还能实现"按一个键自动截指定屏幕区域并识别"的骚操作。所有指令支持简写,比如--screenshot可以缩写成--sc。完整参数和简写规则见项目内的命令行手册:docs/README_CLI.md。
HTTP接口方面,Umi-OCR 启动后本地服务会提供OCR、文档识别、二维码等接口,接口文档在 docs/http/api_doc.md。开发者可以用几十行代码把它封装成自动化流程,实现"上传图片 → 返回JSON识别结果",接口同样只在本地环回通信,不会外泄数据。
最后:记住这三句话就够了
Umi-OCR 是一款免费、开源、离线运行的OCR工具,解压即用;截图、批量、文档识别三大功能,覆盖了从日常摘抄到批量归档的绝大多数场景;遇到问题别慌,忽略区域、排版方案、渲染器这几个旋钮能解决大部分麻烦。下次再收到扫描版PDF或一堆带水印的图片时,打开它,你会发现自己已经不再需要在线工具和手动抄录了。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考