news 2026/8/20 10:49:12

免费离线OCR怎么用?3步跑通截图、批量、PDF文档识别

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
免费离线OCR怎么用?3步跑通截图、批量、PDF文档识别

免费离线OCR怎么用?3步跑通截图、批量、PDF文档识别

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

先讲一件我上周干过的蠢事。同事发来一份扫描版合同,我想引用其中一句条款,全选、复制——弹窗冷冷地提示"无法从此PDF复制文字"。我只好打开在线识别网站,结果文件超了大小限制、免费额度用完,更要命的是,这份敏感合同得先上传到别人的服务器。最后我装了Umi-OCR,一款免费、开源、完全离线的OCR文字识别软件,三分钟解决了这个痛点:图片和PDF全程留在本地硬盘,识别多少张、多大、多快,全由自己说了算。这篇指南就按我踩过的路重走一遍,你照着做就能立刻上手。

一、离线OCR到底赢在哪?一次对比说清楚

先别急着下载,花三十秒搞懂这个选择值不值。

在线OCR的典型流程是:上传图片 → 排队等待 → 限量识别 → 下载结果,中间还夹着"文件超限""免费次数用完"和"数据泄露"三个隐藏代价。而 Umi-OCR 把OCR引擎整个搬进了你的电脑,本地运行、本地计算,给你三个实打实的好处:

  • 不限量:识别多少张都由你说了算,深夜挂机跑几百张图也不会被限流。
  • 零泄露:图片和文档不离开硬盘,合同、论文、身份证件随便丢进去。
  • 免安装:绿色软件,解压即用,连注册账号和联网激活都省了。

一句话总结它的定位:给Windows和Linux用户的一把"本地文字剪刀",剪哪里、剪多少,全凭你。下面我们正式上路。

二、从下载到启动:全程只要3个动作

Umi-OCR 不需要安装,这是它最舒服的一点。拿到压缩包后,你只需要做三件事:

  1. 下载:从项目发布页获取.7z压缩包或.7z.exe自解压包。如果电脑没装压缩软件,直接选自解压包,双击就能解开。
  2. 解压:解压到任意目录,比如D:/Tools/Umi-OCR。这里有个小提醒——路径里别带中文和空格,可以减少一些莫名其妙的兼容问题。
  3. 启动:Windows 双击Umi-OCR.exe,Linux 运行umi-ocr.sh

第一次启动时,软件会自动读取你的系统语言,把界面切成对应语言。程序主体由多个标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置,就像浏览器的标签栏,想用哪个点哪个,右上角还能锁定标签防止误关。

还有一个容易被忽略的细节:启动前把软件目录加入杀毒软件白名单。因为内置了本地OCR引擎和运行库,部分杀软会误报,加个白名单能省去后续"为什么闪退"的烦恼。

三、截图OCR:屏幕上看见的字,1秒变可复制文本

日常最高频的场景,是看到一段文字想立刻复制。打开"截图OCR"标签页,按下快捷键唤起截图框,划出目标区域,识别结果立刻出现在右侧记录栏里。

看这张图:左侧是截图预览,右侧是识别记录,识别完直接划选复制,不用再经过任何中转。

几个很实用的小习惯,试过就回不去:

  • 不用截图也能识别:在聊天窗口复制一张图片,回到 Umi-OCR 直接粘贴,它照样帮你识别。
  • 结果能二次编辑:右侧记录栏里的文字可以直接改错,多条记录一起划选复制,识别完顺手就能整理成想要的格式。
  • 竖排文字也不怕:排版解析会自动处理横排和竖排(从右到左)的文本,只要OCR引擎本身支持竖排即可。

四、批量OCR:几百张图一起扔进去,顺手干掉水印

截图识别只是开胃菜,真正体现效率的是"批量OCR"。遇到几十上百张截图、扫描件、相册照片,一张张截屏就太亏了。切到"批量OCR"标签页,把图片直接拖进窗口,支持jpg、png、webp、bmp、tif、tiff等常见格式,一次拖几百张也没有数量上限。

注意看右侧:每张图片的耗时、置信度和识别结果逐条列出,任务跑完可以按需导出。

点下"开始任务",右侧会逐张显示耗时、置信度和结果。任务跑完后,能按需输出成txt、jsonl、md、csv(Excel可直接打开)四种格式。对于挂机场景,它还支持任务完成后自动关机或待机——睡前扔进去几百张图,醒来直接拿结果。v2.1.2 起还支持暂停任务,只要软件不退出,待机/休眠后可以接着跑。

这里重点讲一个高频痛点解法:忽略区域。批量图片角落的水印、LOGO、页眉页脚,每次都会混进识别结果里。在批量识别页右侧设置里进入忽略区域编辑器,按住右键在图片上绘制多个矩形框,把水印可能出现的位置全部框住,识别时这些区域内的文字就会被自动排除。

但有一个必须记住的机制:只有完全处于矩形框内部的整个文本块才会被忽略,而不是单个字符。所以画框时宁可大一点,把水印所有可能出现的位置都包住,否则漏框一次,结果里就混进一行杂音。

五、文档识别:把扫描版PDF变成可搜索的文本

如果说前面是热身,文档识别就是压轴功能。它支持pdf、xps、epub、mobi、fb2、cbz六种格式,扫描版PDF是最典型的应用场景。

底层逻辑可以概括为三步:解析 → 识别 → 重组。PDF先被拆开,区分出"本来就有的文本层"和"需要OCR的扫描图片层";扫描图片交给本地OCR引擎逐页识别;最后按阅读顺序重新拼装输出。操作上有两个亮点值得展开:

  • 双层可搜索PDF:对扫描版PDF做OCR后,输出"底层是原图、上层是透明文字"的双层PDF。外观跟原扫描件一模一样,但里面的文字可以搜索、复制、划线。给公司做历史合同归档、给学校做论文数字化,这个功能能直接顶上去。
  • 灵活的提取模式:Umi-OCR会优先尝试提取PDF自带的文本层(速度快、零识别误差),只有遇到纯扫描页才自动切换OCR。你也可以主动选择整页强制OCR,或反过来只提取原文本。v2.1.2 起还能输出单层纯文本PDF,想要体积小、好编辑的文件就选它。

文档识别同样支持忽略区域(可按页码范围设置),用来排除扫描件的页眉页脚,也能设置任务完成后的自动关机。手头有一堆扫描版书要转成可搜索存档的话,这个标签页能省下大量人工。

六、新手最容易搞砸的4件事,一次性说清

把最常见的报错集中成一份清单,遇到问题直接对号入座:

  1. 忽略区域画了却没效果?检查矩形框是否够大——只有整个文本块完全在框内才会被忽略;再确认是否保存了忽略区域配置。
  2. 长图识别结果缺胳膊少腿?去"文字识别"设置里调高限制图像边长,而不是盲目放大原图——过度放大会增加噪声,反而降低准确率。
  3. 截图时界面闪烁、错位?这是显卡渲染兼容问题。去"全局设置 → 界面和外观 → 渲染器",切换渲染方案或直接关闭硬件加速,通常能解决。
  4. 命令行指令没反应?Umi-OCR 依赖本地HTTP服务进行进程间通信,请确认全局设置里HTTP服务已开启(默认开启,且仅监听本地环回,不经过物理网卡,数据不会外泄)。

遇到界面闪烁或语言不对,答案都在这一页:渲染器开关、界面语言、主题切换,全在这里解决。

七、进阶玩法:命令行和HTTP接口,把OCR塞进你的工作流

对普通用户来说,图形界面已经够用;但如果你想把它嵌入自己的工作流,Umi-OCR 还提供两条"程序化通道"。

命令行模式,入口就是主程序本身。几个常用姿势:

# 截屏识别,结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片,结果输出到文件 umi-ocr --path "D:/扫描件.png" --output result.txt # 识别整个文件夹(含子目录) umi-ocr --path "D:/scans" "--> " all_result.txt # 生成二维码 umi-ocr --qrcode_create "你好,Umi-OCR" "D:/qrcode.png" 256

配合快捷键工具(如 HotkeysCMD),还能实现"按一个键自动截指定屏幕区域并识别"的骚操作。所有指令支持简写,比如--screenshot可以缩写成--sc。完整参数和简写规则见项目内的命令行手册:docs/README_CLI.md。

HTTP接口方面,Umi-OCR 启动后本地服务会提供OCR、文档识别、二维码等接口,接口文档在 docs/http/api_doc.md。开发者可以用几十行代码把它封装成自动化流程,实现"上传图片 → 返回JSON识别结果",接口同样只在本地环回通信,不会外泄数据。

最后:记住这三句话就够了

Umi-OCR 是一款免费、开源、离线运行的OCR工具,解压即用截图、批量、文档识别三大功能,覆盖了从日常摘抄到批量归档的绝大多数场景遇到问题别慌,忽略区域、排版方案、渲染器这几个旋钮能解决大部分麻烦。下次再收到扫描版PDF或一堆带水印的图片时,打开它,你会发现自己已经不再需要在线工具和手动抄录了。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/20 10:47:10

分层强化学习可解释性评估:构建透明AI协作伙伴的实践框架

1. 从“黑盒”到“透明伙伴”:为什么我们需要理解AI的决策? 在《Overcooked》这款模拟厨房合作的游戏里,你和队友手忙脚乱地切菜、煮汤、上菜,任何一个环节的沟通不畅都可能导致厨房“爆炸”。现在,想象一下你的队友是…

作者头像 李华
网站建设 2026/8/20 10:46:52

从AI音乐生成到文化概念驱动:实战构建概念融合生成引擎

如果你是一名开发者,最近在 GitHub 上看到一些“AI 生成一切”的项目,可能会觉得有点审美疲劳。从生成代码、生成图片,到生成音乐,似乎 AI 正在接管所有创意领域。但当你点开一个名为“哈萨维最爱的一集,随机生成的枪炮…

作者头像 李华
网站建设 2026/8/20 10:43:42

Topit 免费窗口置顶工具实测:5 分钟把任意 Mac 窗口钉在最上层

Topit 免费窗口置顶工具实测:5 分钟把任意 Mac 窗口钉在最上层 【免费下载链接】Topit Pin any window to the top of your screen / 在Mac上将你的任何窗口强制置顶 项目地址: https://gitcode.com/gh_mirrors/to/Topit 你的第三块屏幕在哪?写方…

作者头像 李华