返回 Skill 列表
extension
分类: 数据与分析无需 API Key

网页数据采集向导

当用户想从网页/平台抓取数据、不知怎么合规采集与清洗时使用。输入目标与数据需求即得采集方案、工具选型与清洗步骤。

person作者: user_af163eaahubcommunity

网页数据采集向导

类型:常规 Skill(蓝海补充)|slug:z-web-scrape-guide|版本 V1.0.0

一、定位 / 适用边界

  • 定位:小白向网页/表格数据采集与清洗向导(方法+合规+工具选型)。
  • 适用:当用户想从网页/平台抓取数据、不知怎么合规采集与清洗时使用。输入目标与数据需求即得采集方案、工具选型与清洗步骤。
  • 不适用:严禁绕过付费/登录墙违规抓取、不采集个人信息/受保护数据。与本工作区其他同类 Skill 边界不同,不串用。
  • 标签:网页数据采集向导, 蓝海补充

二、触发词

网页采集 / 数据采集 / 爬虫向导 / 抓取网页数据 / 表格采集

三、能力地图

  • 采集方案设计(目标字段+范围)
  • 合规与 robots 提醒
  • 小白工具选型(无代码/脚本)
  • 清洗与去重步骤

四、工作流程

输入想采集的站点/数据 → 给合规判断(robots/频率/授权)+ 工具路线(浏览器复制/无代码/脚本)+ 字段映射 + 清洗去重步骤 + 导出格式。

五、输出规范

输出=采集方案+工具清单+步骤+导出建议;标注‘遵守目标站条款与法律’。

六、红蓝对抗(高频疑问)

Q:结果不满意?→说明具体场景/约束,重生成或微调。Q:要更专业?→补充领域细节与限制条件。Q:能否批量?→给出结构化模板可逐条套用。

七、使用建议

首次使用先给 1-2 个样例建立预期;复杂任务拆步骤;结果以实际场景校验。

八、红线 / 安全审查

  • 严禁绕过付费/登录墙违规抓取、不采集个人信息/受保护数据;强调遵守 robots 与当地法律;非黑客教程。
  • 不含密钥/token;不生成违规或侵权内容;发布须符合平台规范。

九、版本与来源

  • V1.0.0 · 由本工作空间基于本地 Skill 库缺口分析催生(蓝海方向补全),常规 Skill,未接 API/MCP,纯提示词型。