news 2026/9/17 7:39:07

PaddleOCR Agent Skills 安装指南:三步装好,让 AI 应用搞定文字识别与文档解析

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
PaddleOCR Agent Skills 安装指南:三步装好,让 AI 应用搞定文字识别与文档解析

PaddleOCR Agent Skills 安装指南:三步装好,让 AI 应用搞定文字识别与文档解析

【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR

PaddleOCR 是一款把 PDF 与图片转成结构化数据的开源 OCR 工具包,其官方 Agent Skills 将 OCR 与文档解析任务的触发规则、调用步骤、配置要求打包成可按需加载的模块,让 Claude Code、OpenClaw 等支持 Skills 的 AI 应用直接调用官方 API 完成识别与解析。本文带你完成这两个 Skill 的安装与配置,然后用自然语言触发任务、从输出判断成功。

为什么要把 PaddleOCR 接入 AI 应用

AI 应用处理发票、扫描件或报告 PDF 时,自身视觉能力容易漏掉表格结构、公式与小字号内容。Skills 的思路是把这些任务交给官方托管服务:应用只用自然语言描述任务,Skill 负责提交文件、等待任务、取回结果。全程不需要本地 GPU 推理——Skill 背后运行paddleocr api子命令,它把文件提交到云端处理并取回结果,因此装完 PaddleOCR 后无需额外依赖。

该选哪个 Skill 对应你的任务

两个 Skill 按目标输出二选一,也可以都装:

目标Skill返回内容
只要图片 / PDF 里的纯文本paddleocr-text-recognition行级文本、边界框、置信度
保留文档结构(标题、表格、公式)paddleocr-doc-parsingMarkdown / 结构化结果

⚠️ 目标是纯文本就用 text-recognition;文档含表格、公式、图表或复杂版面就改用 doc-parsing——skills/paddleocr-text-recognition/SKILL.md 明确禁止用它处理这类文档。完整规则见 skills 目录说明与官方 Skills 文档。

动手前备齐三样东西

  1. 执行 Skill 的设备已装 Python 3.9 或更高版本。
  2. 安装 PaddleOCR 3.7.0 及以上版本,该版本提供paddleocr api命令:
pip install "paddleocr>=3.7.0"
  1. 一个 access token:登录百度 AI Studio,在账户设置页的 Access Token 入口获取。它用于 API 鉴权,必须通过环境变量PADDLEOCR_ACCESS_TOKEN(或--token参数)传给 CLI。

安装 Skill:三种方式任选其一

方式一:skills CLI(推荐)

skillsCLI 会把 Skill 全局安装到设备上,装完各 AI 应用均可使用,前提是已装 Node.js:

npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-text-recognition -y npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-doc-parsing -y

只装一个 Skill 时保留对应命令即可。PaddleOCR 仓库较大,网络慢时可能超时;若遇到,先克隆到本地再从本地路径安装:

git clone https://gitcode.com/GitHub_Trending/pa/PaddleOCR npx skills add ./PaddleOCR/skills/paddleocr-text-recognition npx skills add ./PaddleOCR/skills/paddleocr-doc-parsing

方式二:clawhub(OpenClaw 用户)

clawhub install paddleocr-text-recognition clawhub install paddleocr-doc-parsing

安装位置与规则以 OpenClaw 官方 Skills 文档为准。

方式三:手动拷贝

克隆仓库后,把PaddleOCR/skills下对应 Skill 目录拷到 AI 应用指定的位置。Claude Code、claude.ai、OpenClaw 各有各的 Skills 安装说明,具体目标路径查对应应用的文档。

配置 PADDLEOCR_ACCESS_TOKEN 环境变量

🔑 两个 Skill 的 frontmatter 都把PADDLEOCR_ACCESS_TOKEN声明为必需环境变量(primaryEnv),缺失时 Skill 不会正常工作。可选设置PADDLEOCR_BASE_URL更换 API 服务地址,缺省使用官方服务。

Claude Code

在项目根目录的.claude/settings.local.jsonenv字段,<ACCESS_TOKEN>替换为你的 token:

{ "env": { "PADDLEOCR_ACCESS_TOKEN": "<ACCESS_TOKEN>" } }

OpenClaw

~/.openclaw/openclaw.json中把 Skill 条目的enabled置为true并填入 token:

{ "skills": { "entries": { "paddleocr-text-recognition": { "enabled": true, "env": { "PADDLEOCR_ACCESS_TOKEN": "<ACCESS_TOKEN>" } }, "paddleocr-doc-parsing": { "enabled": true, "env": { "PADDLEOCR_ACCESS_TOKEN": "<ACCESS_TOKEN>" } } } } }

其他 AI 应用

应用不在上述列表内时,把 token 以环境变量PADDLEOCR_ACCESS_TOKEN提供给该应用即可;单次调用也可用--token显式传入。

触发任务的标准提示词

配置完成后,直接在应用里用自然语言描述任务,附上文件 URL 或本地路径。标准提示词:

提取这个文件中的全部文本:https://example.com/invoice.jpg 解析这个 PDF,并返回主体内容和全部表格:https://example.com/report.pdf

示例中的 URL 与本地路径都是占位值,替换为你自己的文件即可。Skill 实际执行的是paddleocr api命令,手动验证用最小形态:

paddleocr api --model_type ocr --file_url "https://example.com/image.png" paddleocr api --model_type doc_parsing --file_path "./document.pdf"

--model_type必填且只接受ocrdoc_parsing--file_url--file_path二选一。完整参数以paddleocr api --help及官方 API CLI 文档为准。

平整、方向正确的输入(截图、扫描规范的文档)可以关闭文档预处理(扭曲矫正 + 方向分类)加快结果:

paddleocr api --model_type ocr --file_path "./document.pdf" \ --use_doc_unwarping False --use_doc_orientation_classify False

弯曲、折叠文档的照片,或方向不确定(旋转 90/180/270 度)时,保持预处理开启。

从输出确认成功并处理常见错误

成功时 CLI 向标准输出打印格式化 JSON;用--output指定文件则写入文件并打印保存位置。两种结果结构:

  • ocr结果含jobId与每页prunedResult(内含rec_texts行级文本、rec_scores置信度分数)及ocrImageUrl
  • doc_parsing结果含jobId与每页markdownTextmarkdownImagesoutputImages

✅ 验证方式直接:检查pages是否覆盖目标页码、rec_texts/markdownText与文档实际内容是否一致。

出错时信息进标准错误流、退出码非零,三类常见原因:

  1. token 无效或缺失——检查环境变量是否配置、token 是否过期;
  2. 配额超限——触发了 API 限流;
  3. 未检测到内容——图片是空白页或不含文字。

出错时 AI 应用应向用户说明具体原因,而不是静默回退到自身视觉能力。展示上给出完整提取内容,超过 10,000 字符才允许省略。

自检动作:拿一篇手头的真实 PDF 或图片跑一次上面的提示词,输出里出现与文档一致的rec_textsmarkdownText,链路即打通。

【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/17 7:38:49

VR工程落地指南:从光学畸变到手势识别的实操链路

简介&#xff1a;本资源是一份面向高校师生与VR技术初学者的《VR虚拟现实技术概论》教学课件&#xff0c;系统梳理虚拟现实的核心概念、行业应用与关键技术路径。课件以PPTX格式呈现&#xff0c;共1个文件&#xff0c;大小7.93MB&#xff0c;结构清晰分为三大模块&#xff1a;P…

作者头像 李华
网站建设 2026/9/17 7:37:04

PyCharm插件实战指南:从效率提升到性能优化

我做Python开发这几年&#xff0c;被问得最多的一句话不是“这个功能怎么实现”&#xff0c;而是“你的PyCharm怎么跟我不一样&#xff1f;”——界面更舒服、写代码更快、报错一眼能看懂。说实话&#xff0c;大部分同事和我用的都是同一个PyCharm&#xff0c;差距就出在插件上…

作者头像 李华