PDF补丁丁教程:免费搞定 PDF 合并、书签生成与文档修复的 5 个任务
【免费下载链接】PDFPatcherPDF补丁丁——PDF工具箱,可以编辑书签、剪裁旋转页面、解除限制、提取或合并文档,探查文档结构,提取图片、转成图片等等项目地址: https://gitcode.com/GitHub_Trending/pd/PDFPatcher
你有没有这样的经历:合同扫描件想复制两句话却提示"禁止复制";一本 300 页的电子书没有书签,只能一页页翻;十几个 PDF 和图片散落在各个文件夹,想合并成一个文件,在线工具又满屏广告。这些事其实可以交给一个开源免费的 PDF 处理工具——PDF补丁丁(PDFPatcher):它能把多个文档和图片合并成一个 PDF、自动识别标题生成书签、去除复制和打印限制、提取页面、无损导出图片。Windows 下解压即用,无需安装。
📦 PDF补丁丁怎么安装启动:免安装的便携设计
在 Windows 上,你只需要把压缩包解压,双击运行PDFPatcher.exe就能启动,前提是系统装有 .NET Framework 4.0 到 4.8 的运行环境;卸载也就是删掉目录。想用到文字识别(OCR)功能时,还需要装有 Microsoft Office 2003 或 2007 的文档成像组件(MODI)。
Linux 用户则先装 Mono 框架再运行:
sudo apt install mono-complete mono PDFPatcher.exe界面分上中下三部分:顶部是菜单和工具栏,中间是当前功能的文件列表,底部是功能切换区。点击工具栏图标就会打开对应功能,每个功能以选项卡形式出现,用不上了点选项卡上的"X"即可关闭;鼠标在图标上停几秒,还会弹出功能说明,第一次上手不必死记图标含义。
🔀 多个 PDF 和图片怎么合并成一个文件:混合格式、拖拽排序
点工具栏"合并文件",把文件加进列表就行:可以用"添加文件"、"添加文件夹",也可以直接从资源管理器拖进来。JPEG、PNG、GIF、BMP、TIFF 图片每个都会变成新文档的一页,多帧图片则每帧一页;双击列表里的 PDF 还能指定只合并哪几页——也就是说,拆分和重排页面可以在同一个界面完成。
排序文件并设置书签文本
文件顺序用鼠标拖动调整,排序菜单提供"按数值和字母顺序"两种:按数值排序时10.pdf会排在3.pdf之后,不会出现1、10、2的尴尬顺序。给列表每一项填上"书签文本",生成的新文档就会带对应书签;留空则不生成该项书签,还可以顺手设置粗体、斜体和文字颜色。
统一页面尺寸与自动旋转页面
在"合并文档选项"里可以指定统一的输出页面尺寸,适合后续打印。勾选"自动旋转页面适应原始内容纵横方向"后,横向图片放入纵向页面时会自动转成横向排版,避免大片空白:
📑 PDF 书签怎么一步生成:自动识别标题、精确定位到页面中部
扫描版或旧文档常常缺书签。PDF补丁丁的"识别标题为书签"功能靠的是文本的排版规律——字体尺寸、字体、行距等,把页面上"明显像标题"的大字抽出来组织成层级书签。注意这不是 OCR,文档本身需要带有可选中的文本。
自动生成书签的操作步骤
- 选择"识别标题为书签",指定原始 PDF 和要输出的 XML 信息文件;
- 点"导出信息文件",在日志窗口查看第一遍识别出的标题、级别和页码;
- 效果不理想就调整"标题文本尺寸"、添加文本过滤列表(可按正则表达式忽略页码、首字下沉等),再跑一遍;
- 满意后转回"处理文件"功能,用独立补丁模式把信息文件写回 PDF。
信息文件就是普通 XML,可以直接用文本编辑器查看和微调,仓库里的 doc/example.xml 就是一份完整样例。
书签编辑器:批量修改与正则查找替换
书签编辑器能添加、修改、删除书签,且书签可以跳到页面中间任意坐标,而不是只跳页首。按住 Ctrl 选中多个书签后可一次性改颜色、样式、目标页码和缩放比例;查找替换支持正则表达式和 XPath 匹配,还能按篇、章、节快速选择整组书签,批量整理一本厚书的目录很省事。它甚至支持从右到左的阅读方式,方便预览竖排文档。
🔧 PDF 文档怎么修复优化:解除限制、清理垃圾数据、嵌入字体
"处理文件"功能下有"独立补丁"和"重命名"两种模式,前者用于修改文档本身,后者根据文档元数据(如作者、标题)自动重命名文件。
独立补丁与信息文件:两种处理模式
独立补丁模式下,程序直接修改源文档并输出新 PDF;也可以先"导出信息文件",把文档属性、页码设置、书签、阅读器初始状态导出为 XML,在外部编辑后再"生成 PDF 文件"导入回去。后者适合把同一套设置复用到一批文档上,输出文件名还支持<源文件名>、<作者>这类替代符,批量任务不用手动重命名。
常见修复项一览
- 去除复制、打印限制;
- 删除打开文档或页面时自动执行的动作(比如自动弹出网页);
- 清理隐藏的 XML 元数据和垃圾数据,减小体积;
- 用 JBIG2 算法重新压缩黑白图片,压缩率高且不伤画质;
- 替换字体或把字库嵌入 PDF,解决在 Kindle 等设备上复制文本乱码的问题;
- 旋转页面、统一页面尺寸、修改页码编号。
✂️ PDF 页面和图片怎么提取:按页码范围、无损导出
按页码范围提取页面
"提取页面"功能把指定页码导出成独立 PDF:填"页码范围"即可,还能用"排除页码范围"剔除不要的页;页码支持逆序写法,如10-1会按 10、9、8……1 的顺序插入,适合需要倒序排页的场景。
无损导出图片
"提取图片"会把文档内图片按原始数据无损导出:扩展名按压缩算法自动判断(JPEG 出 jpg、CCITT/JBIG2 出 tif、Deflate 出 png),文件名掩码可自定义。它还有几个很实用的小开关:把被 PDF 制作工具切碎的同一张图片重新拼合、把上下颠倒的图片翻转回来、反转黑白颠倒的图片、忽略过小的噪点图。另外程序还能把 PDF 页面渲染成图片,或调用 Office 的 MODI 引擎做文字识别。
❓ 常见问题:文档打不开、书签失效、属性乱码怎么办
- 无法打开文档:先确认 PDF 本身没损坏、没有加密码;属性或书签显示乱码时,到"全局选项"里换一个读取编码再试。
- 书签点不动或跳错页:常见于文档被改名或页面被改动,用书签编辑器打开,修正链接的目标页码后补丁回文档即可。
- 大文件内存吃紧:全局选项里"访问 PDF 文档"可切换为"减少占用内存"策略。
- 文档结构探查器:能像树一样查看和修改 PDF 内部节点,适合有 PDF 格式基础的人调试;改坏了不可挽回,动手前一定备份原件。
怎么深入使用:手册、示例文件与源码入口
手册、示例文件与源码位置
仓库自带一份很长的 doc/使用手册.md,"应用示例"一章按场景给出完整操作(修复乱码书签、统一页面尺寸、清除自动弹出网页等),值得对照着做。代码侧,PDF 处理算法集中在 App/Processor/,界面上各功能的窗体在 App/Functions/,想看懂"信息文件"如何落到 PDF 上,从这里入手最顺。
参与方式
项目基于 .NET Framework 4.0–4.8 开发,核心依赖 iText(解析、生成、修改 PDF)和 MuPDF(把页面渲染成位图)两个开源组件。采用 AGPL 外加"良心授权":用户受益后行一件善事即可,没有收费、没有广告。遇到 Bug 或需求可以提 Issue 反馈,熟悉代码后也可以提 PR——约定是不改动 PDFPatcher 命名空间外的第三方代码,单个 PR 不要太大。
最后给两条实用建议:处理重要文档前保留原始文件备份,尤其是用"文档结构探查器"改节点时;做重复任务时先把处理选项配好、把输出命名规则(替代符)定好,再批量跑文件,能省掉大量手动操作。如果使用中发现问题,欢迎到项目 Issue 区描述清楚版本、附截图反馈,一起把它做得更好用。
【免费下载链接】PDFPatcherPDF补丁丁——PDF工具箱,可以编辑书签、剪裁旋转页面、解除限制、提取或合并文档,探查文档结构,提取图片、转成图片等等项目地址: https://gitcode.com/GitHub_Trending/pd/PDFPatcher
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考