news 2026/8/24 4:02:14

如何 10 分钟让扫描 PDF 可搜索可复制:OCRmyPDF 实战指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
如何 10 分钟让扫描 PDF 可搜索可复制:OCRmyPDF 实战指南

如何 10 分钟让扫描 PDF 可搜索可复制:OCRmyPDF 实战指南

【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF

OCRmyPDF 是一款开源 PDF OCR 工具,给扫描版 PDF 叠加一层可搜索的文本层。它不改变文档外观,却能让文档被搜索、复制和归档。适合要处理扫描合同、旧文档、纸质文件的人。

遇到这些情况,你就需要 OCR

  • 扫描合同里想复制一句话,只能对着图片干瞪眼
  • 在扫描文件里搜人名、单号,什么都搜不到
  • 地图、图表类文档想搜地名,又怕处理完图被弄乱

上图是地图扫描文档:OCR 后地名可搜索,地图本身保持原样

两步装好并跑通第一次 OCR

需要 Python 3.11 以上,一条命令安装:

pip install ocrmypdf

再一条命令处理文件,把输出指向新文件:

ocrmypdf scan.pdf searchable.pdf

跑完后 searchable.pdf 和原件看起来一样,但文字已经能选中、能复制。

上图是 OCRmyPDF 实际运行截图:扫描、OCR、转 PDF/A、压缩一步完成

常用 OCR 参数速查

参数作用何时用
-l chi_sim指定识别语言,多语言用+连接文档是中文或中英混合时
--rotate-pages自动把横倒的页面转正扫描方向乱的时候
--deskew纠正倾斜的文字页面歪斜几个角度时
--clean去污点、杂质扫描件背景脏的时候
--oversample 600先以 600 DPI 渲染再识别识别不准、原图模糊时
--pages 1-10只处理指定页大文件先试几页时

进阶玩法

当你需要批量 OCR 整个文件夹

终端一行 for 循环跑完当前目录所有 PDF,输出统一加ocr_前缀:

for f in *.pdf; do ocrmypdf "$f" "ocr_$f"; done

并发太多时加--jobs 1限制进程数即可。

上图是排版密集的技术说明书扫描件,OCR 后即可全文搜索

当你需要抢救低质量扫描件

模糊的低分辨率图别直接识别,先提渲染分辨率再跑 OCR:

ocrmypdf --oversample 600 old.pdf out.pdf

老打字机文档、低清扫描用这一个参数,识别率通常明显提升。

上图是打字机旧文档扫描件,提高分辨率后更容易识别

当你需要归档标准文件

命令末尾加--output-type pdfa,输出就变成符合国际归档标准的 PDF/A-2 文件,适合要长期保存的合同、票据类文档。

翻车与自救

  • 识别结果乱码→ 语言选错了。装语言包(如sudo apt install tesseract-ocr-chi-sim),再用-l chi_sim重跑
  • 大文件处理报内存不足--jobs 1限制并发,或用--pages分段处理
  • 跑完文件没变化→ OCRmyPDF 默认跳过已有文本层的页面;想强制重做加--redo-ocr
  • 装完找不到命令→ 用ocrmypdf --version验证,确认安装目录在 PATH 里

指向扫描 PDF,它就变成可搜索、可复制的文件。完整参数参考项目docs/目录下的官方文档。

【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/24 3:58:06

崔瑗历经坎坷磨难,座右铭警醒自己处世本心

开篇AI优化摘要 崔瑗,东汉著名书法家、文学家,一生仕途坎坷,屡遭冤狱与贬谪,然其《座右铭》以短短二十句、百字之文,凝练了“守愚藏拙、静默谦退、柔弱胜刚强”的道家处世智慧,成为后世文人修身立命的典范…

作者头像 李华
网站建设 2026/8/24 3:55:36

五种高质量像素化方法全解析:从Photoshop到Python编程实现

1. 像素化图像:从技术需求到艺术表达在数字图像处理的日常工作中,我们常常会遇到一个看似简单却内涵丰富的需求:像素化。它远不止是“打马赛克”那么简单。无论是为了保护图像中的敏感信息(如人脸、车牌、个人信息)&am…

作者头像 李华
网站建设 2026/8/24 3:52:06

Edge浏览器插件更新全流程实战:从原理到私有化部署

最近在折腾Edge浏览器插件开发时,发现一个挺普遍但容易被忽略的问题:插件更新机制。很多开发者,包括我自己,都曾遇到过用户反馈“插件怎么还是旧版本”、“自动更新好像没生效”的情况。这背后涉及到Edge插件(基于Chro…

作者头像 李华
网站建设 2026/8/24 3:51:41

MinerU GPU 加速排障实录:AMD ROCm 从比 CPU 慢到 27 页/秒

MinerU GPU 加速排障实录:AMD ROCm 从比 CPU 慢到 27 页/秒 【免费下载链接】MinerU A high-quality tool for convert PDF to Markdown and JSON.一站式开源高质量数据提取工具,将PDF转换成Markdown和JSON格式。 项目地址: https://gitcode.com/OpenD…

作者头像 李华
网站建设 2026/8/24 3:51:13

MultiHeadAttention原理与工程实践:从QKV计算到生产部署

1. 这不是“黑箱”,是工程师能亲手拧紧的齿轮MultiHeadAttention——这个词现在几乎成了AI工程师简历上的标配,但很多人把它当成一个必须背诵的术语,就像当年背三角函数公式一样,知道它重要,却说不清它到底在模型里干了…

作者头像 李华
网站建设 2026/8/24 3:51:01

多智能体协同与组合融合算法:破解大模型价值对齐难题

1. 项目概述:当大模型学会“开会”,价值对齐的难题如何破解? 最近在折腾大语言模型(LLMs)的应用落地时,我反复被一个问题困扰:单个模型能力再强,也总有力不从心的时候,尤…

作者头像 李华