OCRmyPDF 免费OCR指南:如何把扫描PDF变成可搜索文档
【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF
OCRmyPDF 是一款免费开源的命令行 OCR 工具,给扫描版 PDF 叠加一层隐藏的 OCR 文本层,原文图像原样保留,处理全程离线,适合需要本地批量处理 PDF 的新手和文档管理员。
为什么需要它
在线 OCR 服务要上传文件,隐私和数据都过一道云;手机拍照识字一张一张拍,效率低;自己写脚本调 Tesseract,配置繁琐还容易错位。OCRmyPDF 一行命令搞定,且免费。
一行命令装好
三个平台各一行安装命令:
apt install ocrmypdf # Debian / Ubuntu brew install ocrmypdf # macOS pkg install py-ocrmypdf # FreeBSDWindows 或其他发行版可走 WSL 或 pip 安装,具体步骤见 安装文档。
装完跑第一条命令验证:
ocrmypdf 扫描.pdf 输出.pdf用 PDF 阅读器打开输出文件,Ctrl+F搜一个词能命中、选中文字能复制,说明文本层加上了。输出默认是 PDF/A 归档格式,适合长期保存。
照着场景用
场景一:批量识别论文文献
扫描论文页数多、常有中英混排,--language指定识别语言,识别准不准就看这一项;--jobs指定并行核心数,多页文件跑得快:
ocrmypdf --language chi_sim+eng --jobs 4 论文.pdf 输出.pdf跑完每页下方都有可检索文本,--jobs 4在 4 核机器上把活分给四个核心并行执行,晚上挂机正好。
场景二:处理歪斜脏污的票据
账单、发票扫描件普遍又歪又有阴影噪点,--deskew自动摆正倾斜页面,--clean-final用 unpaper 在 OCR 前做去噪预处理,比直接识别准确率高:
ocrmypdf --deskew --clean-final 发票.pdf 输出.pdf处理顺序是先摆正、再清理、最后识别,终端会显示每一步的进度和节省的文件体积。
和在线服务差在哪
| 对比项 | 在线 OCR 服务 | 手机拍照识字 | OCRmyPDF |
|---|---|---|---|
| 数据位置 | 上传到对方服务器 | 上传云端识别 | 全程本地,文件不出机器 |
| 画质 | 常被重压缩 | 受拍照质量限制 | 保留原始嵌入分辨率 |
| 费用 | 按量收费 | 多有次数限制 | 免费开源 |
| 批量 | 一次一个 | 一张一张拍 | 多页多文件排队处理 |
卡住了先查这里
| 现象 | 原因 | 一条命令解决 |
|---|---|---|
| 提示缺少语言包 | 对应的 Tesseract 语言包没装 | apt-get install tesseract-ocr-chi-sim |
| 大文件内存不足 | 整份文件一次载入 | ocrmypdf --pages 1-50 大文件.pdf 部分1.pdf |
| 处理速度偏慢 | 并行数没开 | ocrmypdf --jobs 4 文档.pdf 输出.pdf |
所有参数的完整说明见 官方文档;想自定义识别流程,可以看 内置插件 的实现。
【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考