- AI 技能
- AI 插件
- 人工智能
- 工作流自动化
【免费下载链接】awesome-claude-skills
A curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows
本指南围绕 awesome-claude-skills 仓库中的 webscraping-ai-automation 技能 展开,讲解如何通过 Rube MCP(Composio 官方 MCP 网关)让 Claude 自动执行 Webscraping AI 相关的网页抓取与 AI 数据提取任务。读完本文,你将掌握从"搜索工具 schema"到"检查连接状态"再到"多工具执行"的完整三步式工作流,并理解 schema 合规、会话复用、分页处理等关键实战要点,可直接在自己的 Claude 客户端中落地同类自动化。
技能包定位:一个面向网页抓取自动化的 Claude Skill
webscraping-ai-automation是 composio-skills 目录下众多预构建自动化技能之一。从 README.md 的说明可以确认,这些技能是"为 78 个 SaaS 应用预构建的工作流技能",每个技能都包含工具调用序列、参数指引、已知陷阱和快速参考表,且全部基于从 Composio API 真实发现的工具 slug 编写。
该技能的核心声明记录在 SKILL.md 的 YAML frontmatter 中:
--- name: webscraping-ai-automation description: "Automate Webscraping AI tasks via Rube MCP (Composio). Always search tools first for current schemas." requires: mcp: [rube] ---其中两点值得注意:
requires: mcp: [rube]表明该技能依赖名为rube的 MCP 服务器(即 Composio 的 Rube MCP),这是技能运行的先决条件声明;- description 中特意强调"Always search tools first"(永远先搜索工具),这是整个技能的设计哲学:工具 schema 会随上游 API 演进而变化,因此任何工作流的第一动作都必须是动态发现,而不是硬编码。
从技能标题和定位可以推断,Webscraping AI 是 Composio 提供的一个聚焦网页抓取与内容提取的工具包(toolkit),本技能就是教 Claude 如何规范、安全地调用该工具包下的各项能力。在 composio-skills 中还有多个同级抓取类技能(如 firecrawl-automation、apify-automation、scrape-do-automation),它们共享同一套 Rube MCP 调用模式,可以相互印证。
前置条件:动手前必须满足的三项要求
在运行任何 Webscraping AI 工作流之前,需要确认以下前置条件(原文 Prerequisites 部分):
- Rube MCP 必须已连接,且客户端中可用的
RUBE_SEARCH_TOOLS工具已暴露; - 存在有效的 Webscraping AI 连接:通过
RUBE_MANAGE_CONNECTIONS以webscraping_ai为 toolkit 建立连接; - 每次执行前必须先调用
RUBE_SEARCH_TOOLS获取当前的工具 schema。
第三条是硬性约定。它意味着在 Claude 面对一个抓取任务时,正确的行为顺序是"先查证、后执行",而不是直接调用记忆中或文档示例里的工具名。这一点在后面的"已知陷阱"章节中还会以反例形式强调。
环境配置:四步接入 Rube MCP
Rube MCP 的接入方式非常轻量:在客户端配置中将https://rube.app/mcp添加为 MCP 服务器即可,无需任何 API Key——只需要添加端点就能直接使用。这也是它与需要申请COMPOSIO_API_KEY的传统 Composio 接入方式(可参考 connect/SKILL.md 中的export COMPOSIO_API_KEY="your-key")的重要区别。
接入后按以下四步完成验证(对应原文 Setup 部分):
- 验证 Rube MCP 可用:确认
RUBE_SEARCH_TOOLS能正常响应,这是判断 MCP 连接是否生效的最直接信号; - 调用
RUBE_MANAGE_CONNECTIONS,传入 toolkitwebscraping_ai,发起连接管理; - 若连接状态不是 ACTIVE,按返回的授权链接(auth link)完成第三方应用的授权设置——这通常是一次性的 OAuth 流程,与 connect/SKILL.md 中描述的授权模式一致("Authorize here: ... / Say connected when done",连接会持久保留);
- 确认连接状态为 ACTIVE后再开始运行任何工作流。
其中第 4 步是一个容易被忽略的检查点:连接未激活时直接执行工具通常会失败或返回授权错误,因此"先查状态、再执行"应成为每个工作流的默认习惯。
工具发现:理解 RUBE_SEARCH_TOOLS 的返回内容
在真正执行抓取前,必须先用RUBE_SEARCH_TOOLS做工具发现(Tool Discovery)。原文给出的调用骨架如下:
RUBE_SEARCH_TOOLS queries: [{use_case: "Webscraping AI operations", known_fields: ""}] session: {generate_id: true}参数含义:
queries:数组,其中每个元素是一个查询对象;use_case:描述当前要完成的任务类型,例如"Webscraping AI operations"或更具体的抓取诉求;known_fields:你已知的字段/约束,可为空字符串,交由搜索自行匹配;
session:generate_id: true表示让服务端为本次搜索生成一个新的会话 ID,便于后续步骤在同一会话上下文中续接。
一次成功的搜索会返回四类关键信息:
- 可用工具的 slug(tool slugs)——即后续执行阶段要填入
RUBE_MULTI_EXECUTE_TOOL的工具标识; - 输入 schema(input schemas)——每个工具的参数结构、字段名与类型;
- 推荐的执行计划(recommended execution plans)——服务端给出的建议调用序列;
- 已知陷阱(known pitfalls)——针对当前 use_case 的注意事项。
从源码结构看,Rube MCP 采用"发现(search)→ 连接(connection)→ 执行(execute)"的分层工具设计,RUBE_SEARCH_TOOLS是这条链路的第一环,也是后续一切参数合法性的来源。
核心工作流:三步执行模式
整个技能的核心脉络是一个可复用的三步工作流(Core Workflow Pattern),任何 Webscraping AI 任务都可以套用这一模式。
Step 1:发现可用工具
对应当前任务的具体 use_case 再次搜索,复用已生成的会话 ID:
RUBE_SEARCH_TOOLS queries: [{use_case: "your specific Webscraping AI task"}] session: {id: "existing_session_id"}这一步的输出决定了第 3 步中tool_slug与arguments的取值,因此务必在每轮新任务中都重新执行,而不是沿用历史搜索结果。
Step 2:检查连接状态
在执行工具前再次确认 Webscraping AI 连接处于 ACTIVE 状态:
RUBE_MANAGE_CONNECTIONS toolkits: ["webscraping_ai"] session_id: "your_session_id"toolkits传入数组形式的 toolkit 列表,session_id与第 1 步保持同一会话。若返回状态不是 ACTIVE,则回到 Setup 阶段的授权流程补齐授权后再继续。
Step 3:执行工具
通过RUBE_MULTI_EXECUTE_TOOL一次执行一个或多个已发现的工具:
RUBE_MULTI_EXECUTE_TOOL tools: [{ tool_slug: "TOOL_SLUG_FROM_SEARCH", arguments: {/* schema-compliant args from search results */} }] memory: {} session_id: "your_session_id"参数要点:
tools:数组,每个元素包含tool_slug(必须来自RUBE_SEARCH_TOOLS的搜索结果)和arguments(必须严格符合搜索结果返回的 schema,包括字段名与类型);memory:必须始终提供,即使没有需要传递的状态也要传空对象{};session_id:与发现阶段保持同一会话 ID,实现上下文延续。
一个完整的端到端调用链可以这样组织(注意tool_slug与arguments为占位,实际值一律以RUBE_SEARCH_TOOLS实时返回为准):
① RUBE_SEARCH_TOOLS → 拿到当前可用的抓取工具 slug 与输入 schema ② RUBE_MANAGE_CONNECTIONS → 确认 webscraping_ai 连接 ACTIVE ③ RUBE_MULTI_EXECUTE_TOOL → 按 schema 填入 tool_slug 与 arguments 执行抓取 ④ 若响应含分页 token → 继续携带分页参数拉取直到数据完整第 4 步来自原文"分页"陷阱的提示:大型抓取任务的响应可能被分页返回,需要持续检查分页 token 并继续获取,直至数据完整。
已知陷阱清单:六个实战红线
原文的 Known Pitfalls 部分是整个技能的经验沉淀,逐条继承并解读如下:
| 陷阱 | 解读 |
|---|---|
| 永远先搜索 | 工具 schema 会变化。不先调用RUBE_SEARCH_TOOLS就硬编码工具 slug 或参数,是抓取自动化失败的最常见原因。任何时刻都不要假定一个工具名或参数结构是永久有效的。 |
| 检查连接 | 执行工具前必须通过RUBE_MANAGE_CONNECTIONS确认状态为 ACTIVE。连接过期或未授权时,工具调用会直接失败。 |
| Schema 合规 | 严格使用搜索结果中的字段名与类型。多一个拼写错误的字段、少一个必填参数,都会导致请求被拒绝。 |
| Memory 参数必填 | RUBE_MULTI_EXECUTE_TOOL调用中始终包含memory字段,即使没有状态需要传递,也要传{}。 |
| 会话复用 | 同一工作流内复用 session ID(保持上下文连续),新工作流再生成新 ID(避免上下文污染)。 |
| 分页处理 | 检查响应中是否包含分页 token,若有则继续请求直到拉取完整数据,否则结果会被截断。 |
这六条红线本质上对应三个维度:参数合法性(搜索→schema 合规→memory 必填)、状态管理(连接检查→会话复用)与数据完整性(分页处理)。
快速参考:核心工具速查
原文 Quick Reference 部分给出了 Rube MCP 工具与 Webscraping AI 操作的对应关系,完整继承如下:
| 操作 | 使用方式 |
|---|---|
| 查找工具 | RUBE_SEARCH_TOOLS,传入 Webscraping AI 相关的 use_case |
| 建立连接 | RUBE_MANAGE_CONNECTIONS,toolkit 指定为webscraping_ai |
| 执行工具 | RUBE_MULTI_EXECUTE_TOOL,填入搜索发现的工具 slug |
| 批量操作 | RUBE_REMOTE_WORKBENCH,配合run_composio_tool()使用 |
| 获取完整 schema | RUBE_GET_TOOL_SCHEMAS,适用于返回schemaRef的工具 |
其中后两行对应进阶场景:当需要在远程工作台(workbench)中批量驱动 Composio 工具时使用RUBE_REMOTE_WORKBENCH与run_composio_tool();当搜索结果中某工具以schemaRef引用外部 schema 定义时,则用RUBE_GET_TOOL_SCHEMAS拉取完整 schema 定义后再构造参数。
技能机制与适用前提
需要说明的是,本技能是给 Claude 的"行为说明书",而非独立的可执行程序——它与仓库中其他 skill 一样,遵循 README 中描述的 Claude Skills 机制:技能元数据(name/description)在会话开始时以少量 token 加载,完整正文在 Claude 判断任务相关时才按需加载。因此把它放进~/.config/claude-code/skills/目录(或上传至支持技能的客户端)后,Claude 会在遇到网页抓取类任务时自动激活它,并按照本文所述的三步工作流行动。
从仓库结构看,本技能适合以下场景:需要定时或批量抓取网页内容、需要对抓取结果做 AI 结构化提取、需要把 Webscraping AI 能力编排进更大的多步骤 Agent 流程中。它依赖 Rube MCP 端点可用、Webscraping AI 连接处于 ACTIVE 状态,并且所有实际工具 slug 与参数都以实时搜索结果为唯一事实来源——这也是使用本技能时最需要向 Claude 强调的约束。
- AI 技能
- AI 插件
- 人工智能
- 工作流自动化
【免费下载链接】awesome-claude-skills
A curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows
相关推荐
使用 Rube MCP 自动化 Scrape Do 网页抓取任务:awesome-claude-skills 技能实战指南
使用 Rube MCP 自动化 Scrape Do 网页抓取任务:awesome claude skills 技能实战指南 本文是一份以 awesome cla
AI 技能AI 插件人工智能工作流自动化Scrapingant 自动化 Skill 实战指南:在 awesome-claude-skills 中用 Rube MCP 驱动 Composio 网页抓取工作流
Scrapingant 自动化 Skill 实战指南:在 awesome claude skills 中用 Rube MCP 驱动 Composio 网页抓取工
AI 技能AI 插件人工智能工作流自动化使用 Rube MCP 驱动 Canvas 自动化:awesome-claude-skills 的 canvas-automation 技能实战指南
使用 Rube MCP 驱动 Canvas 自动化:awesome claude skills 的 canvas automation 技能实战指南 本篇技术指
AI 技能AI 插件人工智能工作流自动化
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考