网页抓取助手(生成即用·结构化提取)
触发词:网页抓取、爬虫、Firecrawl、提取网页、抓取文章、结构化提取、scrape、采集 适用场景:把一篇博客转成 Markdown 入库 等(详见下文) 连接与鉴权:Firecrawl:https://api.firecrawl.dev (firecrawl-mcp / firecrawl-py)。官方提供抓取、爬取、提取、地图等端点。
一、核心用途
把网页内容采集标准化:给定 URL,抓取正文并转为干净 Markdown 或结构化字段;支持批量、地图式爬取与防 ban。通过 Firecrawl MCP/API 执行。
二、适用场景
- 把一篇博客转成 Markdown 入库
- 批量抓取某站点产品页字段
- 提取某文档页的表格与正文
- 对一组 URL 做地图式站点采集
- 清洗网页噪声只留正文
三、连接与鉴权(R-去个人化:凭证一律走环境变量,绝不写死 Key/appid/token)
- 接入路径:Firecrawl:https://api.firecrawl.dev (firecrawl-mcp / firecrawl-py)。官方提供抓取、爬取、提取、地图等端点。
- 所需凭证(环境变量占位):
FIRECRAWL_API_KEY:Firecrawl API Key(有免费额度)- 免 Key 说明:否,需申请 Key,免费额度可个人试用。
- 国内可达性:海外服务,国内调用需正常网络出口;注意目标站点的 robots 与版权合规。
四、执行流程
- 接收意图与必要参数(如账号、地址、偏好、查询条件)。
- 校验参数完整性,缺失则询问或以默认偏好补全(不自行臆造未知信息)。
- 调用官方 MCP/API(通过 mcporter 或对应客户端工具)执行对应动作。
- 解析返回,格式化输出(订单号/链接/状态/费用/来源等)。
- 涉及支付、下单、删除、改写等敏感动作 → 展示预览并二次确认后执行;异常时 fail-open 不崩溃。
五、输入 / 输出
- 输入:自然语言指令 + 必要参数(账号、地址、偏好、时间等)。
- 输出:结构化结果(订单号、支付链接、状态、费用、来源 URL 等)+ 下一步建议。
六、异常处理(三级)
- 一级(可恢复):参数缺失 → 询问补全后重试。
- 二级(需确认):支付/下单/删除/改写 → 展示预览,用户确认后执行。
- 三级(终止):Key 无效 / 无权限 / 服务不可达 → 报错并给出申请与排查指引,fail-open 不崩。
七、反模式(禁止)
- 禁止写死任何个人 Key / Token / appid / corpid / mch_id(R-去个人化)。
- 禁止未确认就自动支付、下单、删除或改写远端资源。
- 禁止编造平台不支持的能力、精确的 URL 或数值(R-TEST T3)。
- 禁止越权读取他人账号数据。
八、FAQ
Q:能抓需要登录的页面吗? A:可配置会话 Cookie 抓取受限页,但须确保你有权访问该内容,禁止越权抓取。 Q:和联网搜索怎么选? A:已知 URL 要正文用抓取;未知信息要检索用联网搜索,二者互补。
九、领域参考
- 详见
references/connect.md:官方端点、申请步骤、MCP 客户端配置样例与最小权限提示。
Scan to join WeChat group