news 2026/9/17 6:43:20

如何把 PaddleOCR Agent Skills 装进 AI 应用:一句话文字识别与文档解析完整指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
如何把 PaddleOCR Agent Skills 装进 AI 应用:一句话文字识别与文档解析完整指南

如何把 PaddleOCR Agent Skills 装进 AI 应用:一句话文字识别与文档解析完整指南

【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR

把 PaddleOCR Agent Skills 装进 Claude Code、OpenClaw 这类支持 Skills 的 AI 应用后,一句自然语言就能完成 PaddleOCR 文字识别或文档解析,全程不写代码。从环境准备到验收,我们一次跑通。

一、是什么、怎么选:两个 Skill 各管一件事

Skill 可以把一项任务的触发规则、调用步骤、配置要求和结果处理实践打包成一个模块,AI 应用按需加载它,自己就知道该调什么命令、怎么报错了。PaddleOCR 官方目前提供两个,分工如下:

你的目标对应 Skill你能拿到什么
只要图片或 PDF 里的纯文本paddleocr-text-recognition行级文本 + 边界框 + 置信度
要保留标题、段落、表格、公式等结构paddleocr-doc-parsingMarkdown / 结构化结果

判断标准很直接:目标是纯文本,走文字识别;文档里含表格、公式、图表或多栏版面,走文档解析。前者相当于"把字读给我",后者相当于"把这份文档还给我"。

二、动手前的环境清单:三件事先备好

所有操作都在同一台设备完成,开工前把下面三条勾掉即可:

  1. Python 版本 ≥ 3.9:运行python3 --version确认一下。
  2. 装好 PaddleOCR 3.7.0 及以上pip install "paddleocr>=3.7.0"
  3. 拿到 access token:登录百度 AI Studio,在账户设置里的 Access Token 页面复制。后面要配给它。

可以放心的是,Skill 背后调用的paddleocr api是把文件提交到官方托管服务、等它跑完再取结果的子命令,不做本地推理,所以既不需要 GPU,也不用装额外依赖组。

三、把 Skill 装进 AI 应用:按顺序试三条路

两条 Skill 的源码都在仓库的 skills 目录,规则细节可看文字识别 Skill 规则文件和文档解析 Skill 规则文件。安装按下面顺序来,任一条走通即可停。

路线 1:skillsCLI(需要先装 Node.js)

npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-text-recognition -y npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-doc-parsing -y

这条方式会把 Skill 全局装到设备上,装完各 AI 应用都能用。因为 PaddleOCR 仓库体积较大,网络慢时命令可能超时,此时先把仓库克隆下来,再从本地路径安装:

git clone https://gitcode.com/GitHub_Trending/pa/PaddleOCR npx skills add ./PaddleOCR/skills/paddleocr-text-recognition npx skills add ./PaddleOCR/skills/paddleocr-doc-parsing

路线 2:clawhub(OpenClaw 用户)

clawhub install paddleocr-text-recognition clawhub install paddleocr-doc-parsing

路线 3:手动拷贝(兜底)

克隆仓库后,把PaddleOCR/skills下你要的那个 Skill 目录,拷到你 AI 应用指定的 Skills 位置。拷到哪里,以 Claude Code、claude.ai、OpenClaw 各自的安装说明为准。只装一个 Skill 时,上面所有命令也只保留对应那一条。

四、把 token 交给你的应用:PADDLEOCR_ACCESS_TOKEN 配置方法

核心就是一个环境变量:PADDLEOCR_ACCESS_TOKEN(必填);另有PADDLEOCR_BASE_URL(可选,API 服务地址,不填就用官方服务)。

Claude Code

在项目根目录的.claude/settings.local.json里加env字段,把<ACCESS_TOKEN>换成你的 token:

{ "env": { "PADDLEOCR_ACCESS_TOKEN": "<ACCESS_TOKEN>" } }

OpenClaw

~/.openclaw/openclaw.json里给对应 Skill 加上配置,enabledtrue,token 填进env

{ "skills": { "entries": { "paddleocr-text-recognition": { "enabled": true, "env": { "PADDLEOCR_ACCESS_TOKEN": "<ACCESS_TOKEN>" } }, "paddleocr-doc-parsing": { "enabled": true, "env": { "PADDLEOCR_ACCESS_TOKEN": "<ACCESS_TOKEN>" } } } } }

其他应用

直接把 token 以PADDLEOCR_ACCESS_TOKEN环境变量的形式提供给应用即可;也可以不用环境变量,在单次调用时用--token参数显式传入。

五、第一次触发与验收:提示词、关键参数和成功输出

配置完就可以开口了。直接用自然语言描述任务,再附上文件 URL 或本地路径,AI 应用会自己挑对应的 Skill。下面四种说法都管用:

  • "帮我把这张截图里的文字认出来,逐行列出来:<你的图片链接>"
  • "把这个本地 PDF 里的文本都取出来:C:\docs\invoice.pdf"
  • "解析这份 PDF,我要标题、正文和里面所有表格:<你的 PDF 链接>"
  • "解析本地文件 C:\docs\report.pdf,给我完整的结构化结果。"

Skill 实际执行的是paddleocr api命令。--model_type必填(取值ocrdoc_parsing),--file_url--file_path二选一,手动验证时可以直接跑:

paddleocr api \ --model_type ocr \ --file_path "./document.pdf"

完整参数见 官方 API CLI 文档 或执行paddleocr api --help

成功时你会得到一段格式化 JSON(未指定--output时打印到标准输出)。文字识别结果重点看这几个字段:

{ "jobId": "job-xxx", "pages": [ { "prunedResult": { "rec_texts": ["Line 1", "Line 2"], "rec_scores": [0.98, 0.95] }, "ocrImageUrl": "https://..." } ] }

验收就看两点:pages是否覆盖目标页码、rec_texts内容是否与文档实际内容一致。文档解析(--model_type doc_parsing)的 JSON 结构不同,每页带markdownTextmarkdownImagesoutputImages,验收时主要比对markdownText里的 Markdown 正文。

六、排错、边界与提速:失败输出怎么判断

失败输出怎么判断

命令出错时,信息打到标准错误流(stderr)且退出码非零,凭这两点就能判定失败。常见三类:

  • 认证错误PADDLEOCR_ACCESS_TOKEN缺失或无效。先确认环境变量配没配、token 是否来自 AI Studio 且未过期。
  • 配额错误:API 限流或配额用完,稍后重试。
  • 未检测到内容:输入是空白页,或图里压根没有文字。

SKILL.md 的要求是:CLI 报错时向用户说明具体问题,不要静默失败,也不要悄悄回退到应用自身的视觉能力。

两个 Skill 的适用范围

paddleocr-text-recognition明确不接含表格、公式、图表或复杂版面的文档,这类任务交给paddleocr-doc-parsing

另一条展示规则:结果要完整呈现给用户,只有内容超过 10,000 字符时才允许省略。

预处理开关何时关、何时留

API 默认开着扭曲矫正(use_doc_unwarping)和方向分类(use_doc_orientation_classify)两项预处理。截图、扫描规范的文档这类平整且方向正确的输入,可以直接关掉提速:

paddleocr api --model_type ocr --file_path "./document.pdf" \ --use_doc_unwarping False --use_doc_orientation_classify False

反过来,文档照片弯曲折叠、透视变形明显,或页面转了 90、180、270 度时,预处理要保留,别关。

收尾:拿真实文件跑一遍就通了

到这里,安装、token 配置、调用方式就都齐了。验收动作很简单:从手头挑一份真实 PDF 或图片,用上面任一句提示词发给你装好 Skill 的 AI 应用。输出 JSON 里的rec_textsmarkdownText和文档实际内容对得上,说明整条链路已经打通,之后一句话就能出结果。

【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/17 6:42:24

时序逻辑电路设计详解:从触发器到计数器

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/17 6:42:02

Java企业微信机器人开发实战:合规API与Spring Boot集成

1. 项目概述作为一名长期从事企业级应用开发的Java工程师&#xff0c;我发现微信机器人在企业私域运营和技术支持中扮演着越来越重要的角色。最近基于企微API完成了一个Java微信机器人项目&#xff0c;这套方案不仅实现了消息自动处理、群组管理等功能&#xff0c;更重要的是解…

作者头像 李华
网站建设 2026/9/17 6:41:41

NoC中断排查指南:从路由机制到外设中断实践

1. “noc中断”这个词&#xff0c;为什么每次查出来都不是同一个东西说实话&#xff0c;我第一次搜“noc中断”的时候&#xff0c;弹出的结果是真“散装”的&#xff1a;有讲芯片里NoC&#xff08;Network on Chip&#xff09;互连网络中断路由的&#xff0c;有问LIN串口发送时…

作者头像 李华
网站建设 2026/9/17 6:39:39

OpenClaw翻车后企业级私有化定制智能体平台选型与国产替代方案商推荐2026

一、OpenClaw翻车事件&#xff1a;企业级AI落地的分水岭2026年&#xff0c;开源智能体框架OpenClaw的安全事件在行业内引发广泛关注。依赖外部插件权限、边界模糊、存在公网传输风险、权限颗粒度粗——这些问题在个人使用场景下或许可以容忍&#xff0c;但一旦进入企业核心业务…

作者头像 李华
网站建设 2026/9/17 6:36:51

SpringBoot+Vue智慧药店管理系统开发实践

1. 项目背景与核心价值智慧药店药品信息管理系统是传统药店数字化转型的关键基础设施。随着医药零售行业信息化程度提升&#xff0c;单纯依赖人工记录药品进销存的方式已无法满足现代药店管理需求。这个毕业设计项目通过SpringBoot框架实现了药品全生命周期管理&#xff0c;包含…

作者头像 李华