news 2026/8/31 9:18:11

Umi-OCR 批量识别指南:离线免费,一次导入几百张图片识别成文字

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 批量识别指南:离线免费,一次导入几百张图片识别成文字

Umi-OCR 批量识别指南:离线免费,一次导入几百张图片识别成文字

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、离线的 OCR 工具:截屏、批量图片导入、PDF 文档识别、二维码扫描都装在同一个软件里,全部识别过程在本地完成,不上传任何文件。如果你手头攒了一堆需要提取文字的图片,这篇指南带你把它跑起来。

💼 什么时候需要离线批量OCR

先对号入座,看看你是不是下面这三种情况之一。

  • 档案室里的一沓扫描件。你把一批扫描文件转成了图片,想批量导出里面的文字,又不放心把合同、财务数据传到云端 OCR 服务。
  • 代码截图进笔记。IDE 里的报错、终端里的日志,你想转成纯文本存进笔记软件,缩进结构还得保住。
  • 几百张截图等处理。截图工具里堆了几百张带水印的截图,一张张手动识别不现实,需要排队一次性跑完。

Umi-OCR 的批量页没有数量上限,支持jpg、png、webp、bmp、tif等格式,还能给任务配"完成后自动关机"——夜里挂机识别,早上看结果。

⚡ 四步跑通批量识别流程

最短路径如下,全程不用配环境、不用装依赖。

  1. 下载解压。拿到.7z压缩包后解压,双击Umi-OCR.exe启动(Windows)或umi-ocr.sh(Linux)。目的是得到一个解压即用的程序,不写注册表、不需要安装步骤。
  2. 导入图片。打开"批量OCR"标签页,点"选择图片",可多选文件或整个文件夹。目的是把待识别图片排进左侧任务列表。
  3. 选语言和排版方案。在右侧"设置"里选识别语言,再从 OCR 文本后处理里挑一个排版解析方案。目的是让输出顺序、换行符合文档类型,这一步直接决定结果好不好用。
  4. 开始任务并保存结果。点"开始任务",进度条走完,识别文本按你选的格式(txt、md、jsonl、csv)存入指定目录,支持每张图一个文件或多图合并。

💡 不想点按钮的话,Umi-OCR 也能被命令行驱动,把上面的步骤写进脚本里。

📷 核心功能:四个标签页各管一事

截图OCR:识别完还能整理排版

按快捷键截一块屏幕,右侧立刻出识别记录。左侧预览栏支持划选复制,右侧记录栏可以编辑、合并复制多条记录;在别处复制图片,也能直接粘贴进来识别。

识别只是第一步,"文本后处理"的排版解析方案会按文档结构重新排序文字:

  • 多栏 / 单栏 × 自然段换行 / 总是换行 / 无换行,共六种预设;
  • 代码截图用"单栏-保留缩进",行首空格原样保留;
  • 以上方案都能自动处理横排和竖排(从右到左)的文字方向。

批量OCR:导入、排队、保存

批量页就是上面演示的流程:左侧列图片、耗时和状态,右侧看每张图的识别记录。除了格式齐全,它还有两个批量场景常用的设计——支持任务完成后自动关机或待机,以及下面的"忽略区域"。

⚠️ 注意:超长的长图默认会被压缩到边长上限以内再识别,像素超大的图记得先调高设置里的"限制图像边长"。

忽略区域:把水印从结果里抹掉

批量页设置里可以打开忽略区域编辑器:按住右键在预览图上画若干矩形框,框内出现的文字在整个任务中都会被跳过。

  • 矩形框要画大一点,把水印可能出现的所有位置都包进去;
  • 生效粒度是"整个文本块",不是单个字符:框内的文本块全部忽略,框外保留。

文档识别:PDF 扫描件变可搜索 PDF

支持pdf、xps、epub、mobi、fb2、cbz六种格式。对扫描版 PDF 做 OCR,对已有文本层的 PDF 直接提取原文,最后能输出双层可搜索 PDF——上层是原图,下层是可复制搜索的文字。它同样支持忽略区域,排除页眉页脚很方便。

界面与调用方式

  • 界面语言:跟随系统自动切换,也可在"全局设置 → 语言"里手动改,内置繁中、英文、日文、俄语等。
  • 命令行 / HTTP 接口:识别单图、整目录、二维码读写都能被外部程序调用,适合做自动化流程,细节见命令行手册和HTTP接口手册。

🎯 场景实战:输入、参数、输出怎么配

技巧散着记容易忘,按场景打包成"输入 → 参数 → 输出"的组合,照抄就行。

学术论文 PDF,按自然段还原文档

  • 输入:300DPI 扫描件导出的 PDF,或页面截图。
  • 参数:文档识别;识别语言选中文;排版方案选"多栏-按自然段换行";页眉页脚用忽略区域框掉。
  • 输出:双层可搜索 PDF,段落和栏序与原文一致,方便复制和检索。

代码截图,缩进一个空格都不丢

  • 输入:IDE 或终端截图。
  • 参数:识别语言选英文;排版方案选"单栏-保留缩进"。
  • 输出:带缩进的纯文本代码,直接粘回编辑器能跑。

超长截图,先调边长再识别

  • 输入:几万像素高的整页长图。
  • 参数:设置 → 文字识别 → "限制图像边长"调大数值。
  • 输出:长图完整识别,不丢底部内容。

带水印的截图,画两个框就干净了

  • 输入:四角带水印或 LOGO 的截图。
  • 参数:批量页开启忽略区域编辑器,右键画矩形框包住水印区域。
  • 输出:结果里没有水印文字,正文完整。

🧩 常见问题:现象、原因、解法

1. 批量任务跑得很慢。现象:一张图要几秒,几十个文件排到怀疑人生。 原因:离线引擎走的是 CPU 单线程处理,速度受硬件限制,这是离线方案换取不联网的代价。 解法:分批跑;任务排在空闲时段,并勾选完成后自动关机/待机;长任务交给命令行或HTTP接口后台执行,界面别盯着。

2. 大图识别后内容缺了、字也不全。现象:超长图只识别出一部分,或整行文字缺字。 原因:原图边长超过默认上限,被压缩后再送进引擎,细节丢了。 解法:在"设置 → 文字识别 → 限制图像边长"里调高数值再重跑。

3. 多栏文档的结果顺序是乱的。现象:左右两栏的文字被拼成了一行接一行的乱序段落。 原因:用的是"不做处理"或栏数不匹配的方案,原文顺序没被重排。 解法:按实际版式换方案——多栏排版选"多栏-按自然段换行",普通文档选"单栏-按自然段换行",换完立刻看记录页对比。

4. 竖排繁体文档识别不全。现象:从右往左排的繁体字,有的整列没被识别。 原因:识别语言库选的是简体中文,引擎本身不覆盖竖排繁体。 解法:识别语言改选繁体中文,配合排版解析方案的竖排方向自动处理。

写在最后

Umi-OCR 的价值很朴素:离线、免费、批量没有数量上限,截屏到 PDF 都在一个软件里。想继续深入,命令行手册和HTTP接口手册是入口。打开批量OCR标签页,先拿十个文件试一把,比读十篇教程都直接。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 9:16:33

React主流库全解析:路由、状态管理与数据请求实战

React 的“主流库”不像表面上那么少。很多人一聊 React 生态,脑子里只有 React Router 和 Redux,但实际上常用的路由、状态管理、数据请求、表单、UI 组件、动画、跨端框架加起来至少有 10 个以上。这次我们把 React 生态里最常用的主流库全部过一遍&am…

作者头像 李华
网站建设 2026/8/31 9:15:18

SLMs + IRM 为 Coding Agent 加装独立安全闸门:部署与评测实践

Coding Agent 跑得再快,安全闸门没守住,就是在给生产环境埋雷。最近看到一个很有意思的方案标题:用 SLMs 加 IRM 在 Coding Agent 安全场景对标 GPT5.5-xhigh 这类旗舰大模型。核心思路不是堆更大的模型,而是把“干活”和“安检”…

作者头像 李华
网站建设 2026/8/31 9:12:19

免费大模型API使用指南:从注册、避坑到批量调用与报错排查

免费大模型API 是很多开发者在学习、做Demo、跑自动化任务时最想找的资源。市面上确实有一些公益API站点,注册后送额度,也有人整理过几十个入口,标题常常写成“一次打包,注册就送”。但真正用起来,比“找不到API”更常…

作者头像 李华
网站建设 2026/8/31 9:06:25

三极管输出特性曲线详解:从原理到工程实战

1. 三极管输出特性曲线到底是什么 先问一个可能让很多刚接触硬件的同学困惑的问题:我们经常看三极管的数据手册,里面那张“密密麻麻”的曲线图,到底有什么用? 其实它是在解决一个非常基础的问题: 三极管工作在什么状…

作者头像 李华
网站建设 2026/8/31 9:05:45

腾讯云智前端一面实录:从项目深挖到八股文的完整复盘

1. 面试前的信息收集与准备思路 去年年底我投了腾讯云智的前端岗位,等了一周左右收到了约面电话。说实话,一开始我对云智的了解仅限于“腾讯云底下做政企解决方案的子集团”,但真正细化到业务线、技术栈、面试侧重点,还是有点模糊…

作者头像 李华