网页数据采集向导
类型:常规 Skill(蓝海补充)|slug:
z-web-scrape-guide|版本 V1.0.0
一、定位 / 适用边界
- 定位:小白向网页/表格数据采集与清洗向导(方法+合规+工具选型)。
- 适用:当用户想从网页/平台抓取数据、不知怎么合规采集与清洗时使用。输入目标与数据需求即得采集方案、工具选型与清洗步骤。
- 不适用:严禁绕过付费/登录墙违规抓取、不采集个人信息/受保护数据。与本工作区其他同类 Skill 边界不同,不串用。
- 标签:网页数据采集向导, 蓝海补充
二、触发词
网页采集 / 数据采集 / 爬虫向导 / 抓取网页数据 / 表格采集
三、能力地图
- 采集方案设计(目标字段+范围)
- 合规与 robots 提醒
- 小白工具选型(无代码/脚本)
- 清洗与去重步骤
四、工作流程
输入想采集的站点/数据 → 给合规判断(robots/频率/授权)+ 工具路线(浏览器复制/无代码/脚本)+ 字段映射 + 清洗去重步骤 + 导出格式。
五、输出规范
输出=采集方案+工具清单+步骤+导出建议;标注‘遵守目标站条款与法律’。
六、红蓝对抗(高频疑问)
Q:结果不满意?→说明具体场景/约束,重生成或微调。Q:要更专业?→补充领域细节与限制条件。Q:能否批量?→给出结构化模板可逐条套用。
七、使用建议
首次使用先给 1-2 个样例建立预期;复杂任务拆步骤;结果以实际场景校验。
八、红线 / 安全审查
- 严禁绕过付费/登录墙违规抓取、不采集个人信息/受保护数据;强调遵守 robots 与当地法律;非黑客教程。
- 不含密钥/token;不生成违规或侵权内容;发布须符合平台规范。
九、版本与来源
- V1.0.0 · 由本工作空间基于本地 Skill 库缺口分析催生(蓝海方向补全),常规 Skill,未接 API/MCP,纯提示词型。
Scan to join WeChat group