返回 Skill 列表
extension
分类: 数据与分析无需 API Key

批量网页信息提取器

批量从多个网页中识别并提取用户指定的特定信息(如价格、标题、联系方式、文章正文、列表数据、表格内容等),支持粘贴 URL 列表或上传 Excel 文件导入网页地址。输出结构化结果,包含原文依据和置信度,并可导出为 Excel/CSV 文件。This skill should be used when the user wants to batch extract, identify, locate, or pull out specific fields/information from multiple web pages — e.g. "批量提取这些网页里的价格", "帮我把这些链接的产品信息都抓出来", "上传一个网页列表 Excel 批量提取", "batch extract product info from these URLs", "scrape these 50 pages for...", "导入网页链接批量抓取数据". 也适用于用户明确说"这些网页都帮我提取XX"(URL 数量 ≥ 3)的场景。不用于单页面提取(已有 web-info-extractor skill)、网页全文翻译、截图、自动化测试或填写表单。

person作者: user_029a8f8dhubcommunity

批量网页信息提取

触发词

中文触发词(任一命中即触发)

批量 + 网页提取类:

  • 批量提取网页 / 批量抓取网页 / 批量网页提取 / 批量爬取网页
  • 多个网页提取 / 多 URL 提取 / 一批网页提取
  • 这些网页都帮我提取 / 这几个链接都抓一下

上传/导入类:

  • 上传网页列表 / 上传 URL 列表 / 导入网页链接
  • Excel 批量提取 / 表格导入网页 / 用 Excel 批量抓取
  • 上传一个网页清单 / 从 Excel 读取网页列表

明确超过 3 个 URL 的提取请求:

  • 用户一口气给出 ≥ 3 个 URL 并要求提取同类信息
  • 用户说"这几个网页/链接都帮我提取 XX"

English Trigger Words

  • batch extract from web pages / batch scrape websites
  • bulk URL extraction / extract from multiple URLs
  • upload URL list / import URL list / Excel batch extraction
  • scrape these pages for... (with ≥ 3 URLs)

触发条件

满足任一条件即触发:

  1. 用户明确要求"批量"从多个网页提取信息;
  2. 用户提到"上传"、"导入"网页列表或 URL 清单;
  3. 用户一次性给出 3 个以上的 URL,并要求提取相同类型的信息;
  4. 用户说"这些网页/链接都帮我..."。

不触发的情况

  • 仅 1-2 个 URL 的提取请求(使用 web-info-extractor skill);
  • 网页全文翻译或摘要(通用翻译/总结任务);
  • 网页截图或视觉对比;
  • 网页自动化操作(填写表单、点击按钮等);
  • 仅要求"打开看看"的泛读请求。

执行逻辑

第一步:确认提取目标

  1. 从用户话语中整理出要提取的字段清单。如果用户未明确,主动列出建议字段清单,请用户确认。
  2. 常见批量提取场景:
    • 电商产品信息:商品名称、价格、销量、评价数、商家名称
    • 新闻/文章信息:标题、发布时间、作者、正文摘要
    • 企业信息:公司名称、地址、电话、邮箱、联系人
    • 招聘信息:职位名称、薪资、地点、公司、要求
  3. 向用户确认提取字段清单后,进入第二步。

第二步:获取网页列表

向用户提示以下选项:

请提供需要提取的网页列表,你可以选择以下方式之一:

A) 直接粘贴 URL 列表 — 每行一个 URL,例如:

https://example.com/page1
https://example.com/page2
https://example.com/page3

B) 上传 Excel 文件 — 文件应包含一列 URL(列名建议为"链接"、"URL"、"网页地址"等),可附带其他参考列(如备注、分类等)。

如果用户选择 A(粘贴 URL):

  1. 解析用户粘贴的文本,提取每行中的 URL。
  2. 验证 URL 格式(以 http://https:// 开头)。
  3. 列出识别到的 URL 数量和清单,请用户确认。

如果用户选择 B(上传 Excel):

  1. 确认用户已上传文件并提供了文件路径。
  2. 使用 Python(pandas 或 openpyxl)读取 Excel 文件。
  3. 自动识别 URL 列(匹配列名包含"链接"、"URL"、"网址"、"网页"、"link"、"address"等关键词的列;若无匹配,列出所有列名请用户指定)。
  4. 提取 URL 列数据,去重并过滤空值。
  5. 列出识别到的 URL 数量和清单,请用户确认。
  6. 如需安装依赖:/Users/zhouyh/.workbuddy/binaries/python/envs/default/bin/pip install openpyxl pandas

第三步:逐页提取信息

  1. 对确认后的每个 URL,使用 WebFetch 工具获取页面内容:
    • 传入 URL 和明确的提取指令(指定要提取的字段);
    • 如果某个 URL 获取失败,记录失败原因并继续下一个。
  2. 在返回的内容中定位每个目标字段。
  3. 定位策略(按优先级):
    • 语义匹配:理解上下文,找到与目标字段语义最匹配的段落;
    • 模式匹配:对价格、日期、电话号码、邮箱等有固定格式的字段,用正则辅助定位;
    • 结构遍历:对列表/表格,保持原始行列结构进行逐条提取。
  4. 铁律:
    • 禁止编造:找不到的字段如实记录为"未找到",不得猜测或虚构;
    • 原文依据:每个提取值必须附带原文摘录(evidence);
    • 低置信度提醒:当字段存在多个候选或匹配模糊时,降低置信度并提醒人工核对。

第四步:结构化输出

严格按照 references/output_schema.md 定义的格式输出结果。

输出层次:

  1. 汇总表(先呈现):URL、目标字段数、成功字段数、失败字段数、平均置信度;
  2. 详细结果(每个 URL 一个区块):字段名、提取值、证据、置信度;
  3. 缺失字段清单:列出所有未成功提取的字段及原因。

输出形式:

  • 对话内:Markdown 汇总表 + 详细结果(可折叠);
  • 文件导出:生成 Excel 文件(含汇总 sheet 和详细结果 sheet),用 present_files 交付;
  • CSV 导出:当用户只需要简单数据时,生成 UTF-8 with BOM 编码的 CSV 文件。

第五步:收尾确认

  1. 汇总统计:总 URL 数、成功/失败/部分成功数量、整体成功率、平均置信度;
  2. 列出所有失败的 URL 及失败原因(页面无法访问、内容不完整、动态渲染等);
  3. 对动态渲染页面(SPA),告知用户 WebFetch 仅能获取静态 HTML,建议手动提供页面 HTML 源码;
  4. 主动提示:是否需要将本次字段清单固化为模板,供下次同类网页批量提取直接复用。

Excel 文件格式说明

当用户选择上传 Excel 时,文件应满足以下格式:

  • URL 列:必须包含一列 URL,列名建议为"链接"/"URL"/"网址"/"网页地址"/"link"等;
  • 可选列:可包含备注、分类、标签等辅助信息列,这些列会在结果中一并保留;
  • 多个 sheet:默认读取第一个 sheet;若需指定 sheet,请用户说明。

详细格式说明见 references/excel_format.md


与 web-info-extractor 的关系

  • web-info-extractor:单页面或少页面(1-2 个 URL)的精细提取;
  • web-batch-extractor(本 skill):批量(≥ 3 个 URL)的规模提取,支持 Excel 导入。

当用户给出 3 个以上 URL 并要求提取信息时,优先使用本 skill。两个 skill 共享相同的输出格式规范(web-info-extractor 中的 references/output_schema.md)。


资源

  • references/excel_format.md — Excel 上传格式详细说明。
  • references/output_schema.md — 结构化输出字段定义、置信度规则与呈现方式(与 web-info-extractor 共用规范)。