Umi-OCR 免费离线OCR软件指南:三步跑通截图识别,几百张图片一次转文本
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
在线 OCR 要先上传文件、还可能限速。Umi-OCR 是一款免费、开源、离线的文字识别工具,图片从头到尾不出你的电脑,解压后双击即可开工。
三分钟装好:解压即用,免安装离线运行
下载并启动
- 从项目的发布渠道下载
.7z压缩包(或.7z.exe自解压包,适合没装压缩软件的电脑)。 - 解压到任意文件夹,双击里面的
Umi-OCR.exe,软件直接打开,全程没有安装步骤。 - 支持 Windows 7 x64 及以上、Linux x64。如果你更习惯命令行,也可用 Scoop 安装:
scoop bucket add extras scoop install extras/umi-ocr首次启动改两个设置
第一次打开会加载识别模型,稍慢属正常现象,之后再启动就快了。建议先做两件事:
- 界面语言:进入
全局设置→语言/Language。软件会先按系统语言自动匹配,想换随时改,内置简中、繁中、英语、日语等。 - 识别语言:在
截图OCR页根据图片内容选择对应语言;文档里中英混杂时选包含两种语言的组合,识别率明显更好。
三步跑通第一次截图识别
设一个顺手的热键
打开截图OCR标签页,把唤起截图的快捷键改成你顺手的组合,改完立即生效。这一步决定之后提取屏幕文字有多快。
框选文字,看结果
- 按下你刚设好的快捷键,鼠标在屏幕上框住文字区域;按
Esc可随时取消。 - 松开后识别结果自动进入剪贴板,直接去别处粘贴。
- 右侧识别记录栏还能再编辑、划选复制;左侧图片预览区也支持鼠标划选复制。
- 连续处理相邻区域时,可重复上一次截图,效率更高;在别处复制图片后,也能直接粘贴进软件识别。
几百张图片一次转成文本
这一页是批量图片转文本的主力入口,适合把一堆扫描件、产品图统一处理。
拖入图片开始任务
- 切到
批量OCR标签页,把几百张图片一次拖进去,没有数量上限。 - 支持的格式有 jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff。
- 点开始,任务会自动跑完,也可以设置完成后自动关机或待机,夜间挂机很省心。
挑一个顺手的输出格式
识别结果可保存为四种格式,按需选择:txt便于人工阅读编辑、jsonl便于程序处理、csv可直接用 Excel 打开统计、md便于做笔记归档。
扫描PDF变可搜索文档,顺手扫生成二维码
把扫描件变成可搜索的 PDF
文档识别页支持 pdf、xps、epub、mobi、fb2、cbz 六类格式:扫描版走 OCR,电子 PDF 直接提取原有文本。关键能力是输出双层可搜索 PDF——保留原始版式的同时能用关键词搜索,这是把扫描论文变成电子档的关键一步。多页文档可批量处理,同样支持完成后自动关机。
扫二维码、生成码一体
二维码页可以截图、粘贴或拖入本地图片读取其中的码,一张图里有多个码也能全部识别,共覆盖 19 种协议(QRCode、DataMatrix、EAN13、Code128、PDF417、Aztec 等)。反过来,输入文本就能生成二维码图片,纠错等级等参数可调。
两个让结果更干净的技巧
用忽略区域去掉水印、页眉页脚
批量处理带 Logo、页码的文档时,这些干扰文字会混进结果:
- 在批量 OCR 页右侧设置中进入"忽略区域"编辑器;
- 按住鼠标右键,把水印可能出现的位置全部框住,可以画多个矩形;
- 框内完整的文本块会在任务中被跳过,框外内容正常保留。
画框尽量大一些,把所有可能位置包进去,效果更稳。文档识别页也能设同样的忽略区域。
用排版解析还原多栏与代码缩进
识别引擎给出的文字块顺序不一定符合阅读习惯,"排版解析"负责理顺:多栏-按自然段换行自动识别双栏布局,适合论文报告,大部分场景选它就够;单栏-保留缩进专为代码截图设计,保留行首缩进和行内空格,结果能直接粘进编辑器。
进阶:命令行与接口自动调用,以及新手常踩的坑
两条最常用的命令
前提是在全局设置里保持本地 HTTP 服务开启(默认已开启,主机保持"仅本地"即可)。命令行入口就是Umi-OCR.exe,多数系统可直接写umi-ocr:
umi-ocr --path "D:/images" --output "result.txt" umi-ocr --screenshot --clip前者识别文件夹内所有图片并写入文本文件,后者框选屏幕识别后复制到剪贴板。指令支持前缀简写,--help可查看全部说明。写脚本自动调用时,可走 HTTP 接口文档里的/argv接口,效果等价于拼一条命令。
新手最容易卡住的几处
- 识别不全:超长图、超大像素图被截断时,到
页面的设置→文字识别→限制图像边长把数值调高。 - 界面闪烁或错位:在
全局设置→界面和外观→渲染器换一种渲染方案,或关闭硬件加速。 - 配置怎么改:界面设置会存到
UmiOCR-data/.settings,允许手动改后用--reload重新加载。
常用参考:命令行手册 · HTTP接口手册 · 更新日志
离线识别的意义,是让每一份文档始终留在你自己手里。现在就可以解压出Umi-OCR.exe,按一次快捷键,框住屏幕上一段文字试试。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考