核心功能: 本技能提供化工作流场景等能力。
核心功能: 本技能提供、信息收集、、报表生成、统计洞察、数据可视化时使用、化工作流与智能决策辅助等能力。
Scrape Web
付费版进阶功能
| 能力 | 免费版 | 付费版 | |---|---|---| | 基础功能 | 支持 | 支持 | | 代码静态分析与质量评分 | 不支持 | 支持 | | 依赖漏洞检测与升级建议 | 不支持 | 支持 | | 批量代码审查与报告生成 | 不支持 | 支持 | | CI/CD流水线集成 | 不支持 | 支持 | | 代码复杂度可视化与重构建议 | 不支持 | 支持 |
功能能力
部署指引
- 确认运行环境满足依赖说明中的要求
- 在AI Agent对话中调用本技能,提供必要的输入参数
- 检查输出结果,根据需要进行后续处理
详细的输入输出格式请参考下方章节说明。
适用范围
| 场景 | 输入 | 输出 | |:-----|:-----|:-----| | 使用 Python | 目标数据与配置参数 | 处理结果与执行状态 | | 支持简单选择器 | 目标数据与配置参数 | 处理结果与执行状态 |
不适用于:需要人工判断的复杂决策场景
操作流程
- 确认运行环境满足依赖说明中的要求
- 根据适用场景选择合适的使用方式
- 执行操作并检查输出结果
- 如遇错误,参考错误处理章节
参数说明
| 参数名 | 类型 | 必填 | 说明 | |---:|---:|---:|---:|
| instruction | string | 是 | 用户指令文本 | | context | string | 否 | 上下文信息 |
输出规范
{
"success": true,
"data": {
result: "web 相关配置参数",
result: "web 相关配置参数"
},
"error": null
}
异常应对
| 错误场景 | 原因 | 处理方式 | |:---:|:---:|:---:| | 配置错误 | 参数缺失或格式错误 | 检查依赖说明中的配置要求 | | 运行时错误 | 运行环境不满足 | 确认运行环境符合依赖说明 | | 网络错误 | 连接超时或不可达 |
环境要求
运行环境
- Agent平台: 支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
- 操作系统: Windows / macOS / Linux
第三方依赖
| 依赖项 | 类型 | 是否必需 | 获取方式 | |:------|------:|:------|:------| | LLM API | API | 必需 | 由Agent内置LLM提供 |
API Key 配置
可用性分类
- 分类: MD+execute()
- 说明: 基于Markdown的AI Skill,
API Key配置方式:
export API_KEY="${API_KEY:?请设置环境变量}"
配置后需重启会话或开启新终端生效。API Key应妥善保管,避免泄露到版本控制系统.
异常应对机制
| 错误场景(续)| 原因 | 处理方式 | |----:|:----|----:| | LLM响应超时或无响应 | 网络延迟或模型负载过高 | 请求重试;确认Agent平台LLM服务正常 | | 输入内容格式不正确 | 用户输入不符合skill预期格式 | 检查输入是否符合skill使用说明中的格式要求,参考示例章节 | | 执行结果与预期不符 | 指令描述不够明确或上下文不足 | 提供更详细的指令描述,补充必要的上下文信息 | | 命令执行失败 | 运行环境不满足要求或权限不足 | 确认运行环境符合依赖说明中的要求;检查命令权限设置 |
创新特色
效率提升量化分析
| 操作步骤 | 手动耗时 | 自动化耗时 | 时间节约 | 准确率提升 | | --- | --- | --- | --- | --- | | 网页内容抓取 | 1小时 | 10分钟 | 50分钟 | 10% | | 数据提取与清洗 | 2小时 | 30分钟 | 1.5小时 | 15% | | 数据存储与整理 | 1小时 | 20分钟 | 40分钟 | 5% | | 多网页抓取 | 4小时 | 1小时 | 3小时 | 20% | | 定期更新与监控 | 2小时/周 | 15分钟/周 | 1.75小时/周 | 10% |
差异化对比
| 对比维度 | 本技能 | 手动操作 | Python脚本 | 专业软件 | | --- | --- | --- | --- | --- | | 易用性 | 高 | 低 | 中 | 高 | | 功能性 | 强 | 弱 | 中 | 强 | | 成本 | 低 | 中 | 高 | 高 | | 扩展性 | 中 | 低 | 高 | 高 | | 维护性 | 低 | 中 | 中 | 高 |
核心痛点解决
| 痛点 | 描述 | 影响范围 | 解决方案 | 量化效果 | | --- | --- | --- | --- | --- | | 数据获取效率低 | 手动抓取数据耗时较长,效率低下 | 降低工作效率,增加人力成本 | 自动化抓取,提高数据获取效率 | 时间节约50% | | 数据准确性差 | 手动提取数据容易出错,影响分析结果 | 影响数据分析和决策的准确性 | 使用简单选择器提高数据提取准确性 | 准确率提升10% | | 数据更新不及时 | 定期手动更新数据,耗时费力 | 影响数据的时效性和决策的准确性 | 自动化更新数据,提高数据时效性 | 时间节约75% |
常见问题FAQ
Q1: 如何安装和使用爬虫网页技能?
A: 首先,确保运行环境满足依赖说明中的要求。然后,在AI Agent对话中调用本技能,提供必要的输入参数。检查输出结果,根据需要进行后续处理。
Q2: 爬虫网页技能支持哪些类型的网页抓取?
A: 爬虫网页技能支持简单选择器的网页抓取,可以获取网页中的文本、图片、链接等数据。
Q3: 爬虫网页技能的准确率如何?
A: 爬虫网页技能的准确率取决于网页结构和简单选择器的使用。一般来说,准确率在90%以上。
Q4: 爬虫网页技能是否支持自定义选择器?
A: 目前版本不支持自定义选择器,但未来可能会加入这一功能。
Q5: 爬虫网页技能是否支持多线程抓取?
A: 目前版本不支持多线程抓取,但未来可能会加入这一功能以提高效率。
诊断与修复
| 错误现象 | 可能原因 | 诊断步骤 | 解决方案 | | --- | --- | --- | --- | | 抓取失败 | 网页结构变化或网络问题 | 检查网页结构是否变化,确认网络连接正常 | 重新抓取或修改选择器 | | 数据提取错误 | 选择器错误或数据格式问题 | 检查选择器是否正确,确认数据格式符合预期 | 修改选择器或数据格式 | | 执行超时 | 网页响应慢或抓取数据量大 | 检查网页响应速度,调整抓取数据量 | 优化抓取策略或分批抓取 | | 权限不足 | 没有权限访问某些网页 | 确认运行环境权限设置 | 获取相应权限或修改抓取策略 |
安全提示
- 避免抓取受版权保护的网页内容。
- 尊重网站robots.txt文件,遵守网站抓取规则。
- 避免对目标网站造成过大压力,合理控制抓取频率。
- 保护抓取到的数据安全,防止数据泄露。
- 避免使用爬虫进行非法活动,遵守相关法律法规。
安全风险防范
| 风险项 | 等级 | 防护措施 | 验证方法 | | --- | --- | --- | --- | | API密钥泄露 | 高 | 通过环境变量配置,禁止硬编码 | 定期检查代码和配置文件 | | 命令执行风险 | 高 | 仅执行白名单命令,避免拼接用户输入 | 使用沙箱环境测试 | | 网络通信安全 | 中 | 使用HTTPS协议,验证SSL证书 | 定期检查证书有效期 | | 敏感数据暴露 | 高 | 输出结果中不包含密钥、令牌等敏感信息 | 日志脱敏审查 | | 未授权访问 | 中 | 限制访问权限,实施认证机制 | 定期审计访问日志 |
主要功能
- 自动化执行: 使用 Python +
- 文件处理: 支持多种文件格式的读取、解析和写入操作
- API集成: 通过标准化接口调用外部服务并处理响应
- 命令执行: 在安全沙箱中执行系统命令并收集结果
功能矩阵
- 自动化执行: 使用 Python +
- 文件处理: 支持多种文件格式的读取、解析和写入操作
- API集成: 通过标准化接口调用外部服务并处理响应
- 命令执行: 在安全沙箱中执行系统命令并收集结果
入门指引
- 配置API密钥: 在环境变量中设置对应的API Key
- 初始化连接: 使用提供的凭证建立API连接
- 调用接口: 传入必要参数执行API调用
- 准备文件: 确认文件路径正确且格式受支持
- 执行处理: 调用对应的处理函数
- 查看结果: 检查输出文件或返回数据
- 检查环境: 确认运行时和依赖已安装
- 执行命令: 使用正确的参数格式执行
- 查看输出: 检查命令输出和退出码
前置条件
- 已安装所需运行环境(参考依赖说明)
- 已获取必要的API密钥或访问凭证(如适用)
- 输入数据已准备就绪
Scan to join WeChat group