返回 Skill 列表
extension
分类: 数据与分析需要 API Key

网页抓取助手(生成即用·结构化提取)

当用户需要网页抓取助手相关能力时使用(网页抓取、爬虫、Firecrawl、提取网页、抓取文章、结构化提取、scrape、采集)。本 skill 提供连接与鉴权指引、执行流程、异常处理与反模式,指导 Agent 通过官方 MCP/API 完成结构化提取相关任务。

person作者: user_af163eaahubcommunity

网页抓取助手(生成即用·结构化提取)

触发词:网页抓取、爬虫、Firecrawl、提取网页、抓取文章、结构化提取、scrape、采集 适用场景:把一篇博客转成 Markdown 入库 等(详见下文) 连接与鉴权:Firecrawl:https://api.firecrawl.dev (firecrawl-mcp / firecrawl-py)。官方提供抓取、爬取、提取、地图等端点。

一、核心用途

把网页内容采集标准化:给定 URL,抓取正文并转为干净 Markdown 或结构化字段;支持批量、地图式爬取与防 ban。通过 Firecrawl MCP/API 执行。

二、适用场景

  • 把一篇博客转成 Markdown 入库
  • 批量抓取某站点产品页字段
  • 提取某文档页的表格与正文
  • 对一组 URL 做地图式站点采集
  • 清洗网页噪声只留正文

三、连接与鉴权(R-去个人化:凭证一律走环境变量,绝不写死 Key/appid/token)

  • 接入路径:Firecrawl:https://api.firecrawl.dev (firecrawl-mcp / firecrawl-py)。官方提供抓取、爬取、提取、地图等端点。
  • 所需凭证(环境变量占位)
  • FIRECRAWL_API_KEY:Firecrawl API Key(有免费额度)
  • 免 Key 说明:否,需申请 Key,免费额度可个人试用。
  • 国内可达性:海外服务,国内调用需正常网络出口;注意目标站点的 robots 与版权合规。

四、执行流程

  1. 接收意图与必要参数(如账号、地址、偏好、查询条件)。
  2. 校验参数完整性,缺失则询问或以默认偏好补全(不自行臆造未知信息)。
  3. 调用官方 MCP/API(通过 mcporter 或对应客户端工具)执行对应动作。
  4. 解析返回,格式化输出(订单号/链接/状态/费用/来源等)。
  5. 涉及支付、下单、删除、改写等敏感动作 → 展示预览并二次确认后执行;异常时 fail-open 不崩溃。

五、输入 / 输出

  • 输入:自然语言指令 + 必要参数(账号、地址、偏好、时间等)。
  • 输出:结构化结果(订单号、支付链接、状态、费用、来源 URL 等)+ 下一步建议。

六、异常处理(三级)

  • 一级(可恢复):参数缺失 → 询问补全后重试。
  • 二级(需确认):支付/下单/删除/改写 → 展示预览,用户确认后执行。
  • 三级(终止):Key 无效 / 无权限 / 服务不可达 → 报错并给出申请与排查指引,fail-open 不崩。

七、反模式(禁止)

  • 禁止写死任何个人 Key / Token / appid / corpid / mch_id(R-去个人化)。
  • 禁止未确认就自动支付、下单、删除或改写远端资源。
  • 禁止编造平台不支持的能力、精确的 URL 或数值(R-TEST T3)。
  • 禁止越权读取他人账号数据。

八、FAQ

Q:能抓需要登录的页面吗? A:可配置会话 Cookie 抓取受限页,但须确保你有权访问该内容,禁止越权抓取。 Q:和联网搜索怎么选? A:已知 URL 要正文用抓取;未知信息要检索用联网搜索,二者互补。

九、领域参考

  • 详见 references/connect.md:官方端点、申请步骤、MCP 客户端配置样例与最小权限提示。