PaddleOCR Agent Skills 安装指南:三步装好,让 AI 应用搞定文字识别与文档解析
【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR
PaddleOCR 是一款把 PDF 与图片转成结构化数据的开源 OCR 工具包,其官方 Agent Skills 将 OCR 与文档解析任务的触发规则、调用步骤、配置要求打包成可按需加载的模块,让 Claude Code、OpenClaw 等支持 Skills 的 AI 应用直接调用官方 API 完成识别与解析。本文带你完成这两个 Skill 的安装与配置,然后用自然语言触发任务、从输出判断成功。
为什么要把 PaddleOCR 接入 AI 应用
AI 应用处理发票、扫描件或报告 PDF 时,自身视觉能力容易漏掉表格结构、公式与小字号内容。Skills 的思路是把这些任务交给官方托管服务:应用只用自然语言描述任务,Skill 负责提交文件、等待任务、取回结果。全程不需要本地 GPU 推理——Skill 背后运行paddleocr api子命令,它把文件提交到云端处理并取回结果,因此装完 PaddleOCR 后无需额外依赖。
该选哪个 Skill 对应你的任务
两个 Skill 按目标输出二选一,也可以都装:
| 目标 | Skill | 返回内容 |
|---|---|---|
| 只要图片 / PDF 里的纯文本 | paddleocr-text-recognition | 行级文本、边界框、置信度 |
| 保留文档结构(标题、表格、公式) | paddleocr-doc-parsing | Markdown / 结构化结果 |
⚠️ 目标是纯文本就用 text-recognition;文档含表格、公式、图表或复杂版面就改用 doc-parsing——skills/paddleocr-text-recognition/SKILL.md 明确禁止用它处理这类文档。完整规则见 skills 目录说明与官方 Skills 文档。
动手前备齐三样东西
- 执行 Skill 的设备已装 Python 3.9 或更高版本。
- 安装 PaddleOCR 3.7.0 及以上版本,该版本提供
paddleocr api命令:
pip install "paddleocr>=3.7.0"- 一个 access token:登录百度 AI Studio,在账户设置页的 Access Token 入口获取。它用于 API 鉴权,必须通过环境变量
PADDLEOCR_ACCESS_TOKEN(或--token参数)传给 CLI。
安装 Skill:三种方式任选其一
方式一:skills CLI(推荐)
skillsCLI 会把 Skill 全局安装到设备上,装完各 AI 应用均可使用,前提是已装 Node.js:
npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-text-recognition -y npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-doc-parsing -y只装一个 Skill 时保留对应命令即可。PaddleOCR 仓库较大,网络慢时可能超时;若遇到,先克隆到本地再从本地路径安装:
git clone https://gitcode.com/GitHub_Trending/pa/PaddleOCR npx skills add ./PaddleOCR/skills/paddleocr-text-recognition npx skills add ./PaddleOCR/skills/paddleocr-doc-parsing方式二:clawhub(OpenClaw 用户)
clawhub install paddleocr-text-recognition clawhub install paddleocr-doc-parsing安装位置与规则以 OpenClaw 官方 Skills 文档为准。
方式三:手动拷贝
克隆仓库后,把PaddleOCR/skills下对应 Skill 目录拷到 AI 应用指定的位置。Claude Code、claude.ai、OpenClaw 各有各的 Skills 安装说明,具体目标路径查对应应用的文档。
配置 PADDLEOCR_ACCESS_TOKEN 环境变量
🔑 两个 Skill 的 frontmatter 都把PADDLEOCR_ACCESS_TOKEN声明为必需环境变量(primaryEnv),缺失时 Skill 不会正常工作。可选设置PADDLEOCR_BASE_URL更换 API 服务地址,缺省使用官方服务。
Claude Code
在项目根目录的.claude/settings.local.json加env字段,<ACCESS_TOKEN>替换为你的 token:
{ "env": { "PADDLEOCR_ACCESS_TOKEN": "<ACCESS_TOKEN>" } }OpenClaw
在~/.openclaw/openclaw.json中把 Skill 条目的enabled置为true并填入 token:
{ "skills": { "entries": { "paddleocr-text-recognition": { "enabled": true, "env": { "PADDLEOCR_ACCESS_TOKEN": "<ACCESS_TOKEN>" } }, "paddleocr-doc-parsing": { "enabled": true, "env": { "PADDLEOCR_ACCESS_TOKEN": "<ACCESS_TOKEN>" } } } } }其他 AI 应用
应用不在上述列表内时,把 token 以环境变量PADDLEOCR_ACCESS_TOKEN提供给该应用即可;单次调用也可用--token显式传入。
触发任务的标准提示词
配置完成后,直接在应用里用自然语言描述任务,附上文件 URL 或本地路径。标准提示词:
提取这个文件中的全部文本:https://example.com/invoice.jpg 解析这个 PDF,并返回主体内容和全部表格:https://example.com/report.pdf示例中的 URL 与本地路径都是占位值,替换为你自己的文件即可。Skill 实际执行的是paddleocr api命令,手动验证用最小形态:
paddleocr api --model_type ocr --file_url "https://example.com/image.png" paddleocr api --model_type doc_parsing --file_path "./document.pdf"--model_type必填且只接受ocr或doc_parsing;--file_url与--file_path二选一。完整参数以paddleocr api --help及官方 API CLI 文档为准。
平整、方向正确的输入(截图、扫描规范的文档)可以关闭文档预处理(扭曲矫正 + 方向分类)加快结果:
paddleocr api --model_type ocr --file_path "./document.pdf" \ --use_doc_unwarping False --use_doc_orientation_classify False弯曲、折叠文档的照片,或方向不确定(旋转 90/180/270 度)时,保持预处理开启。
从输出确认成功并处理常见错误
成功时 CLI 向标准输出打印格式化 JSON;用--output指定文件则写入文件并打印保存位置。两种结果结构:
ocr结果含jobId与每页prunedResult(内含rec_texts行级文本、rec_scores置信度分数)及ocrImageUrl;doc_parsing结果含jobId与每页markdownText、markdownImages、outputImages。
✅ 验证方式直接:检查pages是否覆盖目标页码、rec_texts/markdownText与文档实际内容是否一致。
出错时信息进标准错误流、退出码非零,三类常见原因:
- token 无效或缺失——检查环境变量是否配置、token 是否过期;
- 配额超限——触发了 API 限流;
- 未检测到内容——图片是空白页或不含文字。
出错时 AI 应用应向用户说明具体原因,而不是静默回退到自身视觉能力。展示上给出完整提取内容,超过 10,000 字符才允许省略。
自检动作:拿一篇手头的真实 PDF 或图片跑一次上面的提示词,输出里出现与文档一致的rec_texts或markdownText,链路即打通。
【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考