news 2026/10/7 2:27:44

Umi-OCR 一篇讲透:免费离线 OCR,从截图取文到批量处理一文件夹文档

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 一篇讲透:免费离线 OCR,从截图取文到批量处理一文件夹文档

Umi-OCR 一篇讲透:免费离线 OCR,从截图取文到批量处理一文件夹文档

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费开源的离线 OCR(文字识别)工具,识别全程在你自己的电脑上完成,不联网。它的活主要有四类:把屏幕截图变成可选中文字、把一文件夹图片批量转成文本文件、把扫描版 PDF 变成可搜索 PDF,外加二维码扫码/生成。适合需要频繁整理文档资料的办公用户,也适合想把 OCR 接进自己脚本的开发者,界面默认中文,几乎零学习成本。

它是什么,为什么值得装一个

几个点一次说清:

  • 不联网:OCR 引擎(RapidOCR / PaddleOCR)内置在本地,识别速度只取决于你自己的电脑,资料不出机器。
  • 解压即用:发布包是.7z压缩包或.7z.exe自解压包,解压后双击Umi-OCR.exe就能跑,没有安装环节 📦
  • 两种调用方式:图形界面之外还支持命令行与 HTTP 接口,写脚本调它只差一条命令,功能细节见 README.md。
  • 双系统都能跑:Windows 7 x64 与 Linux x64 均支持。

界面支持多国语言:第一次启动时按系统语言自动切换,之后随时可手动改,路径是「全局设置 → 语言/Language」,已覆盖简体中文、英语、繁体中文、日语、俄语、葡萄牙语等。

从下载到第一次出文字,只需三步

  1. 下载发布包,解压到一个你记得住的目录,路径保持纯英文,别带空格和特殊字符。
  2. 双击Umi-OCR.exe启动(Linux 用户直接运行umi-ocr.sh),软件默认打开在「截图OCR」标签页。
  3. 按页面上的快捷键唤起截图,框选屏幕上的文字区域,松手后结果就出现在右侧「记录」栏,直接右键选「复制」即可。

到这儿就成功了。图省事的话还可以跳过框选:从别处复制一张图片,直接粘贴进窗口,同样能识别。

先干一票真的:把一文件夹扫描件变成可搜索 PDF

功能清单先放一边,咱拿真实活练手:桌面上有个文件夹放满扫描版 PDF,要把它们变成能 Ctrl+F 的文件 🔍

准备

  • 新建一个output文件夹存放结果;打开「文档识别」标签页。
  • 把扫描文件拖进任务列表,支持pdf, xps, epub, mobi, fb2, cbz。

操作

  • 如果每页页脚都有页码水印,先进「忽略区域」编辑器,用右键把页脚条框住。注意被忽略的是框内「整个文本块」,框要完全包住水印可能出现的位置。
  • 输出格式勾选「双层可搜索PDF」;只想要纯文本内容的话,也可以选「单层纯文本PDF」。
  • 任务完成设置选「自动关机」,就可以去忙别的了。进度条逐页推进,中途电脑休眠也没关系,任务支持暂停后恢复,不用从头再来。

结果验证

打开output文件夹,能看到与原件同名的双层可搜索PDF:版式和原件一模一样,但鼠标能选中、能复制、Ctrl+F 能搜到任意文字,页脚页码也不再混进结果。任务跑完,机器按设置自动关机。

四个标签页,各管一段活

网页和软件界面里的文字选不中,看截图OCR

这是软件默认的第一个标签页,好用点在三处:

  • 左预览、右记录:左侧预览栏直接用鼠标划选复制;右侧「记录」栏可以先编辑文字再复制,还支持划选多条记录一起复制。

  • 排版解析方案决定可读性:在「文本后处理 - 排版解析方案」里,报刊双栏内容选「多栏-按自然段换行」,代码截图选「单栏-保留缩进」(行首空格、行内空格都保留),想要引擎原始输出就选「不做处理」。
  • 横排竖排都能自动处理:竖排(从右到左)也能识别,前提是引擎本身支持。

代码截图是个好试金石,选「单栏-保留缩进」时缩进和空行都保住了:

一次框选,文字带着正确排版回来,记录面板还会保留历史,随时翻回去补选。

一文件夹图片一次性转成文本文件,用批量OCR

手机拍的讲义、扫描件照片,一个文件夹几十张甚至几百张要逐张过字的活,交给这一页:

  • 把图片文件夹拖进任务列表,支持jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff格式,数量没有上限。
  • 右栏勾选输出格式:txt, jsonl, md, csv(Excel),可以多选同时保存。
  • 图片角落有水印或 LOGO 的话,进「忽略区域」编辑器用右键画矩形框住,框内整个文本块会被跳过。
  • 提交任务,还能设任务完成后自动关机 / 自动待机。

跑完一整批,每张图都会留下一个一一对应的文本文件,任务列表里还标着每张图的耗时与置信度,方便你把没认好的挑出来重跑。

扫描版 PDF 想被搜到,用文档识别

这一页就是给搜不了字的纯扫描文档准备的:

  • 拖入文档,支持pdf, xps, epub, mobi, fb2, cbz。
  • 文档自带文本层的,直接提取原文,不重复识别;纯扫描件则逐页 OCR。
  • 输出勾选「双层可搜索PDF」(版式不动、叠加一层可搜索文字)或「单层纯文本PDF」。
  • 搭配「忽略区域」,可以把页眉页脚之类的文字排除在外。

产物是一份能归档、能检索的PDF,样子和原来没区别,但 Ctrl+F 是真能用的。

二维码:扫得出来,也生成得出来

  • 扫码方向:截图、粘贴或拖入本地图片,读取其中的二维码、条形码,支持一图多码,覆盖QRCode、EAN13、DataMatrix、PDF417等 19 种协议。
  • 生成方向:输入文本,选定协议、纠错等级和图片尺寸,就能产出一张二维码图片。

两种方向的结果都能直接用:前者还你解码后的文本,后者还你一张能存下来就用的二维码图。

这几个地方调对了,事半功倍

  • 限制图像边长→ 要识别超大长图、大图时 → 在识别页「设置 → 文字识别」里把数值调高,否则超出的部分会被压缩截断,识别结果不完整。
  • 排版解析方案→ 多栏文档、代码截图时 → 分别选「多栏-按自然段换行」或「单栏-保留缩进」,别一直用默认方案将就。
  • OCR引擎插件→ 想对比速度和准确率时 → 在「全局设置」里于 Rapid 与 Paddle 之间切换,大任务前先拿十几张小图试跑。
  • 语言/模型库→ 要识别外语时 → 在 OCR 插件设置里勾选对应语言;勾得越多占内存越多,纯中文场景不必全开。
  • 渲染器→ 老机器出现截图闪烁、界面错位时 → 「全局设置 → 界面和外观」里切换渲染方案或关闭硬件加速。
  • 日志保存级别→ 排查问题想留证据时 → 在全局设置标签页调整级别,日志存放在UmiOCR-data/logs目录。

出问题先看这里 🩹

批量识别超大长图,结果不完整。原因:默认开启了图像边长限制,超出部分被压缩或截断。 解决:在「设置 → 文字识别」里调高「限制图像边长」数值。

结果里总混着水印、页眉页脚。原因:没画忽略区域,或框没包住整个文本块。 解决:用右键画矩形框,被忽略的是框内整个文本块,框要把水印可能出现的所有位置都圈进去。

老显卡机器截图时闪烁、UI 错位。原因:默认显卡加速渲染与该机型不兼容。 解决:「全局设置 → 界面和外观 → 渲染器」里切换渲染方案或关闭硬件加速。

脚本里调命令行,收不到识别结果。原因:umi-ocr的结果不能用系统的>或|重定向。 解决:改用--output "file.txt"写文件或--output_append追加,完整参数表见 命令行手册。

Linux 老系统启动报错。原因:运行库依赖不满足。 解决:选用稳定的 release 分支,Linux 侧要求 glibc 2.31 以上,大致对应 Debian 11、Ubuntu 20 及之后的系统。

版本信息、文档与源码去哪拿

当前稳定版本为v2.1.5(2025.3.26),这一版新增了日志机制和--reload配置重载指令,完整沿革见 更新日志。

  • 开发者向:命令行调用方式见 docs/README_CLI.md,HTTP 接口(可传 Base64 图片直接识别)见 docs/http/README.md,具体接口参数还能在 docs/http/api_ocr.md 里展开。
  • 遇到 Bug 直接到项目的 Issue 页面提交;界面翻译在 Weblate 平台上协作维护,已覆盖十几种语言,也欢迎译者参与。
  • 拿源码(日常使用建议看 release 分支,main、dev可能含有开发中的不稳定功能):
git clone --single-branch --branch main https://gitcode.com/GitHub_Trending/um/Umi-OCR

解压一个发行版,先框一次截图,你会发现离线 OCR 离你的工作流只差一个快捷键 🚀

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/7 2:25:25

重庆市两江新区省心的监控安装认证服务商避坑挑选指南

重庆本安科技发展有限公司是深耕重庆安防弱电智能化视频监控领域24年的本地服务商,核心为工厂、小区、学校、商场、办公楼等各类场所提供一站式监控系统解决方案。 企业基础介绍重庆本安科技发展有限公司成立于2008年,其前身始于2002年成立的重庆卡安电子…

作者头像 李华
网站建设 2026/10/7 2:22:49

Ubuntu 24.04安装搜狗输入法:Fcitx配置与Xorg切换全指南

1. Ubuntu 24.04 输入法架构的变化:为什么这次装搜狗比旧版本更折腾1.1 从 IBus 到 Fcitx:两套输入法框架并存时的冲突逻辑如果你是从 Ubuntu 20.04 或 22.04 一路升级到 24.04 的老用户,应该能明显感觉到这次安装搜狗输入法的手感完全不一样…

作者头像 李华