news 2026/9/19 12:47:28

Umi-OCR 免费离线OCR软件指南:三步跑通截图识别,几百张图片一次转文本

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 免费离线OCR软件指南:三步跑通截图识别,几百张图片一次转文本

Umi-OCR 免费离线OCR软件指南:三步跑通截图识别,几百张图片一次转文本

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

在线 OCR 要先上传文件、还可能限速。Umi-OCR 是一款免费、开源、离线的文字识别工具,图片从头到尾不出你的电脑,解压后双击即可开工。

三分钟装好:解压即用,免安装离线运行

下载并启动

  1. 从项目的发布渠道下载.7z压缩包(或.7z.exe自解压包,适合没装压缩软件的电脑)。
  2. 解压到任意文件夹,双击里面的Umi-OCR.exe,软件直接打开,全程没有安装步骤。
  3. 支持 Windows 7 x64 及以上、Linux x64。如果你更习惯命令行,也可用 Scoop 安装:
scoop bucket add extras scoop install extras/umi-ocr

首次启动改两个设置

第一次打开会加载识别模型,稍慢属正常现象,之后再启动就快了。建议先做两件事:

  • 界面语言:进入全局设置语言/Language。软件会先按系统语言自动匹配,想换随时改,内置简中、繁中、英语、日语等。
  • 识别语言:在截图OCR页根据图片内容选择对应语言;文档里中英混杂时选包含两种语言的组合,识别率明显更好。

三步跑通第一次截图识别

设一个顺手的热键

打开截图OCR标签页,把唤起截图的快捷键改成你顺手的组合,改完立即生效。这一步决定之后提取屏幕文字有多快。

框选文字,看结果

  1. 按下你刚设好的快捷键,鼠标在屏幕上框住文字区域;按Esc可随时取消。
  2. 松开后识别结果自动进入剪贴板,直接去别处粘贴。
  3. 右侧识别记录栏还能再编辑、划选复制;左侧图片预览区也支持鼠标划选复制。
  4. 连续处理相邻区域时,可重复上一次截图,效率更高;在别处复制图片后,也能直接粘贴进软件识别。

几百张图片一次转成文本

这一页是批量图片转文本的主力入口,适合把一堆扫描件、产品图统一处理。

拖入图片开始任务

  1. 切到批量OCR标签页,把几百张图片一次拖进去,没有数量上限。
  2. 支持的格式有 jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff。
  3. 点开始,任务会自动跑完,也可以设置完成后自动关机或待机,夜间挂机很省心。

挑一个顺手的输出格式

识别结果可保存为四种格式,按需选择:txt便于人工阅读编辑、jsonl便于程序处理、csv可直接用 Excel 打开统计、md便于做笔记归档。

扫描PDF变可搜索文档,顺手扫生成二维码

把扫描件变成可搜索的 PDF

文档识别页支持 pdf、xps、epub、mobi、fb2、cbz 六类格式:扫描版走 OCR,电子 PDF 直接提取原有文本。关键能力是输出双层可搜索 PDF——保留原始版式的同时能用关键词搜索,这是把扫描论文变成电子档的关键一步。多页文档可批量处理,同样支持完成后自动关机。

扫二维码、生成码一体

二维码页可以截图、粘贴或拖入本地图片读取其中的码,一张图里有多个码也能全部识别,共覆盖 19 种协议(QRCode、DataMatrix、EAN13、Code128、PDF417、Aztec 等)。反过来,输入文本就能生成二维码图片,纠错等级等参数可调。

两个让结果更干净的技巧

用忽略区域去掉水印、页眉页脚

批量处理带 Logo、页码的文档时,这些干扰文字会混进结果:

  1. 在批量 OCR 页右侧设置中进入"忽略区域"编辑器;
  2. 按住鼠标右键,把水印可能出现的位置全部框住,可以画多个矩形;
  3. 框内完整的文本块会在任务中被跳过,框外内容正常保留。

画框尽量大一些,把所有可能位置包进去,效果更稳。文档识别页也能设同样的忽略区域。

用排版解析还原多栏与代码缩进

识别引擎给出的文字块顺序不一定符合阅读习惯,"排版解析"负责理顺:多栏-按自然段换行自动识别双栏布局,适合论文报告,大部分场景选它就够;单栏-保留缩进专为代码截图设计,保留行首缩进和行内空格,结果能直接粘进编辑器。

进阶:命令行与接口自动调用,以及新手常踩的坑

两条最常用的命令

前提是在全局设置里保持本地 HTTP 服务开启(默认已开启,主机保持"仅本地"即可)。命令行入口就是Umi-OCR.exe,多数系统可直接写umi-ocr

umi-ocr --path "D:/images" --output "result.txt" umi-ocr --screenshot --clip

前者识别文件夹内所有图片并写入文本文件,后者框选屏幕识别后复制到剪贴板。指令支持前缀简写,--help可查看全部说明。写脚本自动调用时,可走 HTTP 接口文档里的/argv接口,效果等价于拼一条命令。

新手最容易卡住的几处

  • 识别不全:超长图、超大像素图被截断时,到页面的设置→文字识别→限制图像边长把数值调高。
  • 界面闪烁或错位:在全局设置界面和外观渲染器换一种渲染方案,或关闭硬件加速。
  • 配置怎么改:界面设置会存到UmiOCR-data/.settings,允许手动改后用--reload重新加载。

常用参考:命令行手册 · HTTP接口手册 · 更新日志

离线识别的意义,是让每一份文档始终留在你自己手里。现在就可以解压出Umi-OCR.exe,按一次快捷键,框住屏幕上一段文字试试。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/19 12:46:49

前端面试高频手撕代码清单:从防抖节流到Promise实现全解析

面试这事儿,一旦聊到“手撕代码”,很多人的第一反应就是紧张。明明平时项目写得挺顺,一到白板阶段脑子就空白,Promise.all 怎么写来着?防抖是立即执行还是延迟执行?其实面试官问你手撕题,真不是…

作者头像 李华
网站建设 2026/9/19 12:46:22

FPGA入门:可重构芯片的原理、开发流程与学习路线

你大概率在B站、知乎或者CSDN上刷到过“FPGA”这个词,旁边还总跟着"年薪高""底层""数字IC""硬件编程"这些标签,点进去看了十分钟,关掉页面还是没太想明白:它到底是个芯片,还是…

作者头像 李华
网站建设 2026/9/19 12:44:55

SPSS单因素方差分析全解析:原理、操作、多重比较与Bootstrap

简介:这份PPT系统讲解第5章SPSS的方差分析,面向需要掌握统计检验方法的学生、科研人员或数据分析初学者。内容从方差分析概念入手,厘清因素、水平、单元、元素与交互作用等关键术语,再说明其基本思想、系统性差异与随机性差异的区…

作者头像 李华
网站建设 2026/9/19 12:44:53

软件系统应急预案与快速恢复方案:从RTO/RPO到故障切换实战

简介:面向互联网行业的软件系统应急预案及快速恢复方案,适合运维工程师、技术支持及系统管理员用于故障响应与风险管控。文档以网络基础设施、服务器集群、IVR、CTI、软话机控件等常见故障场景为主线,逐一说明网络中断、网关异常、IVR/CTI服务…

作者头像 李华
网站建设 2026/9/19 12:44:13

Multi-Head Attention工程实践:从原理到稳定训练的完整解剖

1. 这不是“讲清楚”的问题,而是“用明白”的门槛多头注意力(Multi-Head Attention)——这个词在深度学习圈里,已经快被说烂了。你打开任意一篇Transformer相关教程,十有八九第一段就写着“它由多个并行的自注意力头组…

作者头像 李华