批量网页信息提取
触发词
中文触发词(任一命中即触发)
批量 + 网页提取类:
- 批量提取网页 / 批量抓取网页 / 批量网页提取 / 批量爬取网页
- 多个网页提取 / 多 URL 提取 / 一批网页提取
- 这些网页都帮我提取 / 这几个链接都抓一下
上传/导入类:
- 上传网页列表 / 上传 URL 列表 / 导入网页链接
- Excel 批量提取 / 表格导入网页 / 用 Excel 批量抓取
- 上传一个网页清单 / 从 Excel 读取网页列表
明确超过 3 个 URL 的提取请求:
- 用户一口气给出 ≥ 3 个 URL 并要求提取同类信息
- 用户说"这几个网页/链接都帮我提取 XX"
English Trigger Words
- batch extract from web pages / batch scrape websites
- bulk URL extraction / extract from multiple URLs
- upload URL list / import URL list / Excel batch extraction
- scrape these pages for... (with ≥ 3 URLs)
触发条件
满足任一条件即触发:
- 用户明确要求"批量"从多个网页提取信息;
- 用户提到"上传"、"导入"网页列表或 URL 清单;
- 用户一次性给出 3 个以上的 URL,并要求提取相同类型的信息;
- 用户说"这些网页/链接都帮我..."。
不触发的情况
- 仅 1-2 个 URL 的提取请求(使用
web-info-extractorskill); - 网页全文翻译或摘要(通用翻译/总结任务);
- 网页截图或视觉对比;
- 网页自动化操作(填写表单、点击按钮等);
- 仅要求"打开看看"的泛读请求。
执行逻辑
第一步:确认提取目标
- 从用户话语中整理出要提取的字段清单。如果用户未明确,主动列出建议字段清单,请用户确认。
- 常见批量提取场景:
- 电商产品信息:商品名称、价格、销量、评价数、商家名称
- 新闻/文章信息:标题、发布时间、作者、正文摘要
- 企业信息:公司名称、地址、电话、邮箱、联系人
- 招聘信息:职位名称、薪资、地点、公司、要求
- 向用户确认提取字段清单后,进入第二步。
第二步:获取网页列表
向用户提示以下选项:
请提供需要提取的网页列表,你可以选择以下方式之一:
A) 直接粘贴 URL 列表 — 每行一个 URL,例如:
https://example.com/page1 https://example.com/page2 https://example.com/page3B) 上传 Excel 文件 — 文件应包含一列 URL(列名建议为"链接"、"URL"、"网页地址"等),可附带其他参考列(如备注、分类等)。
如果用户选择 A(粘贴 URL):
- 解析用户粘贴的文本,提取每行中的 URL。
- 验证 URL 格式(以
http://或https://开头)。 - 列出识别到的 URL 数量和清单,请用户确认。
如果用户选择 B(上传 Excel):
- 确认用户已上传文件并提供了文件路径。
- 使用 Python(pandas 或 openpyxl)读取 Excel 文件。
- 自动识别 URL 列(匹配列名包含"链接"、"URL"、"网址"、"网页"、"link"、"address"等关键词的列;若无匹配,列出所有列名请用户指定)。
- 提取 URL 列数据,去重并过滤空值。
- 列出识别到的 URL 数量和清单,请用户确认。
- 如需安装依赖:
/Users/zhouyh/.workbuddy/binaries/python/envs/default/bin/pip install openpyxl pandas
第三步:逐页提取信息
- 对确认后的每个 URL,使用
WebFetch工具获取页面内容:- 传入 URL 和明确的提取指令(指定要提取的字段);
- 如果某个 URL 获取失败,记录失败原因并继续下一个。
- 在返回的内容中定位每个目标字段。
- 定位策略(按优先级):
- 语义匹配:理解上下文,找到与目标字段语义最匹配的段落;
- 模式匹配:对价格、日期、电话号码、邮箱等有固定格式的字段,用正则辅助定位;
- 结构遍历:对列表/表格,保持原始行列结构进行逐条提取。
- 铁律:
- 禁止编造:找不到的字段如实记录为"未找到",不得猜测或虚构;
- 原文依据:每个提取值必须附带原文摘录(evidence);
- 低置信度提醒:当字段存在多个候选或匹配模糊时,降低置信度并提醒人工核对。
第四步:结构化输出
严格按照 references/output_schema.md 定义的格式输出结果。
输出层次:
- 汇总表(先呈现):URL、目标字段数、成功字段数、失败字段数、平均置信度;
- 详细结果(每个 URL 一个区块):字段名、提取值、证据、置信度;
- 缺失字段清单:列出所有未成功提取的字段及原因。
输出形式:
- 对话内:Markdown 汇总表 + 详细结果(可折叠);
- 文件导出:生成 Excel 文件(含汇总 sheet 和详细结果 sheet),用
present_files交付; - CSV 导出:当用户只需要简单数据时,生成 UTF-8 with BOM 编码的 CSV 文件。
第五步:收尾确认
- 汇总统计:总 URL 数、成功/失败/部分成功数量、整体成功率、平均置信度;
- 列出所有失败的 URL 及失败原因(页面无法访问、内容不完整、动态渲染等);
- 对动态渲染页面(SPA),告知用户 WebFetch 仅能获取静态 HTML,建议手动提供页面 HTML 源码;
- 主动提示:是否需要将本次字段清单固化为模板,供下次同类网页批量提取直接复用。
Excel 文件格式说明
当用户选择上传 Excel 时,文件应满足以下格式:
- URL 列:必须包含一列 URL,列名建议为"链接"/"URL"/"网址"/"网页地址"/"link"等;
- 可选列:可包含备注、分类、标签等辅助信息列,这些列会在结果中一并保留;
- 多个 sheet:默认读取第一个 sheet;若需指定 sheet,请用户说明。
详细格式说明见 references/excel_format.md。
与 web-info-extractor 的关系
web-info-extractor:单页面或少页面(1-2 个 URL)的精细提取;web-batch-extractor(本 skill):批量(≥ 3 个 URL)的规模提取,支持 Excel 导入。
当用户给出 3 个以上 URL 并要求提取信息时,优先使用本 skill。两个 skill 共享相同的输出格式规范(web-info-extractor 中的 references/output_schema.md)。
资源
references/excel_format.md— Excel 上传格式详细说明。references/output_schema.md— 结构化输出字段定义、置信度规则与呈现方式(与 web-info-extractor 共用规范)。
微信扫一扫