news 2026/9/25 8:51:04

Umi-OCR 离线OCR工具:截图转文字3分钟上手,图片不出本机

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 离线OCR工具:截图转文字3分钟上手,图片不出本机

Umi-OCR 离线OCR工具:截图转文字3分钟上手,图片不出本机

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

图片里的文字复制不走,多半是因为它"只是像素"。Umi-OCR 把截图、扫描件、PDF 变成可复制的文字,全部在本机离线完成,图片不会上传到任何服务器。它免费开源、解压即用,适合 Windows 7 x64 和 Linux x64,断网环境照常工作。

卖点速览:4 件让你用得上的事

  1. 完全离线:内置离线 OCR 引擎和多国语言识别库,全程不联网,识别数据不离开电脑。
  2. 批量不限张数:一次导入几百张 jpg、png、bmp、tiff、webp 图片,结果可存为 txt、md、jsonl、csv(Excel),任务结束还能自动关机,挂着过夜跑。
  3. 排版不跑偏:识别结果可按"排版解析方案"整理顺序,代码截图选"单栏-保留缩进",缩进和空格原样保留。
  4. 两种调用方式:图形界面之外,主程序自带命令行入口和 HTTP 接口,可以写进脚本或被别的程序调用。

快速上手:3 分钟完成第一次识别

  1. 到发布页下载最新版.7z压缩包(或.7z.exe自解压包),解压到任意目录,路径避免中文。
  2. Windows 双击Umi-OCR.exe,Linux 运行umi-ocr.sh,无需安装。
  3. 打开"截图OCR"标签页,按快捷键框选屏幕区域,识别结果自动进入剪贴板,全程约 3 分钟。

典型工作流:3 个高频场景

截图框选取字:选中区域,文字进剪贴板

情况:教程截图、聊天记录里的文字无法直接选中复制。

操作:打开"截图OCR"标签页,按快捷键框选区域,结果自动进剪贴板;右侧"记录"栏里可以编辑、划选多条记录一起复制。别处复制过的图片也能直接粘贴进该页识别,省去重复截图。

效果:复制一次即可粘贴到任何文本框,多条识别结果还能合并复制。

批量扫描件转文字:整文件夹一次跑完

情况:几百张扫描图片要逐张转成文本。

操作:在"批量OCR"页点"选择图片"导入文件夹,支持 jpg、png、bmp、tiff、webp 等格式且没有数量上限;在设置里把结果保存为 txt 或 csv(Excel),开启"任务完成后自动关机",点"开始任务"。

效果:任务列表实时显示每张图的耗时和置信度,过夜即可跑完整个文件夹。

代码截图识别:缩进空格原样保留

情况:把代码截图粘进编辑器,普通识别总把缩进打乱。

操作:在识别设置里把"OCR文本后处理-排版解析方案"选为"单栏-保留缩进",该方案会保留行首缩进和行内空格,横排、竖排均适用。

效果:识别出的代码块粘进编辑器,结构不用手动重排。

进阶调用:命令行与HTTP接口

主程序本身就是命令行入口:把路径丢给umi-ocr即可识别文件夹里全部图片,也可截图识别后直接进剪贴板。需要程序间对接时,可开启 HTTP 接口(默认开启,仅本地环回通信,不经过物理网卡),用 curl 发一个 POST 请求即可拿到识别结果。

umi-ocr --path "D:/images" # 识别文件夹内全部图片 umi-ocr --screenshot --clip # 截图识别,结果进剪贴板

完整参数与请求格式见 命令行手册 和 HTTP接口手册。

高频问题速查:识别不顺怎么办

  • 截图闪烁、界面错位 → 进"全局设置 → 界面和外观",切换"渲染器"或关闭硬件加速。
  • 长图、超清大图识别不全 → 批量OCR页"设置 → 文字识别 → 限制图像边长",调高数值。
  • 双栏文章文字顺序乱 → 排版解析方案换成"多栏-按自然段换行"。
  • 水印、页眉混进结果 → 批量OCR页进入"忽略区域"编辑器,按住右键画矩形框,框要完全包住水印位置;只有整块落在框内的文本会被跳过。
  • 命令行没反应 → 到全局设置确认 HTTP 服务已开启(默认开启,仅本地通信)。
  • 界面不是中文 → "全局设置 → 语言/Language"切换简中、繁中、英文、日文等。
  • 识别漏字 → 确认当前 OCR 引擎的语言包支持该语言,或在全局设置切换另一套引擎。

适配度判断:先对号入座再下载

适合你,如果:

  • 需要离线处理截图、图片、扫描件,数据不能出本机。
  • 有批量转文字需求,愿意挂机跑任务(支持完成后自动关机/待机)。
  • 要从 PDF 扫描件提取文本,或输出"双层可搜索 PDF"——原文排版保留,文字可选中复制。
  • 想扫描条形码/二维码(19 种码制、支持一图多码),或反向由文本生成二维码。

不适合你,如果:

  • 你用 macOS,目前没有对应版本,只支持 Windows 7 x64 和 Linux x64。
  • 你期望还原 Word 排版,它输出的是纯文字,不做版面重建。
  • 你手上是严重模糊、畸变的低质量照片,准确率没有保障。

获取与参与:一行命令开始

  • 仓库克隆:git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR
  • 更新日志:CHANGE_LOG.md
  • Bug 与建议:在仓库提交 Issue;界面翻译通过 Weblate 平台协作

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/25 8:47:38

安全审计实战指南:从威胁建模到漏洞修复的核心方法论与工具链

干安全审计这行久了,我越来越觉得它是一门被低估的手艺。很多人以为“security-audit-skill”就是拿工具扫一遍、出个报告、贴几个漏洞截图,然后拿着报告找开发改一改就完事。说实话,这种认知不仅低估了审计的复杂度,也浪费了它真…

作者头像 李华
网站建设 2026/9/25 8:47:27

Ubuntu上用VirtualBox虚拟机玩《公主连结》的完整指南

最近被朋友问到一个挺有挑战性的需求:能不能在 Ubuntu 上用 VirtualBox 开一个 Windows 虚拟机,然后稳定地玩《公主连结 Re:Dive》。乍一听像是“脱裤子放屁”,但实际操作的人真不少,而且折腾完你会发现,这其实是一个相…

作者头像 李华
网站建设 2026/9/25 8:46:04

ax调度:面向agentic工作负载的Kubernetes CLI编排实践

1. 从“ax”这个名字说起:一个被低估的调度入口第一次看到“ax”这个标题,很多人会以为是某个命令行工具的缩写,或者某个内部项目的代号。但把热搜词摊开来看——agentic、orchestrator、Kubernetes、CLI、ax调度——这几个词拼在一起&#x…

作者头像 李华