核心功能: 本技能提供中文交互、、排名提升、搜索流量优化时使用、、关键词分析、排名提升、搜索流量优化时使用、化工作流场景等能力。
Discrawl
付费版扩展能力
| 能力 | 免费版 | 付费版 | |---|---|---| | 基础功能 | 支持 | 支持 | | 多标签页并行抓取 | 不支持 | 支持 | | 反爬虫策略自动绕过 | 不支持 | 支持 | | 页面结构变化自适应 | 不支持 | 支持 | | 批量导出结构化数据 | 不支持 | 支持 | | Cookie池管理与IP轮换 | 不支持 | 支持 |
能力一览
- Discord archive: search, sync freshness, DMs, channel slices, SQL counts
场景示例
| 场景 | 输入 | 输出 | |:-----|:-----|:-----| | Discord归档搜索 | 频道ID和搜索关键词 | 匹配消息列表和元数据 | | 新鲜度同步 | 频道和最后同步时间 | 增量更新的消息记录 | | DM和频道切片 | 用户ID或频道范围 | 消息切片和SQL统计 |
不适用于:非Discord平台的社媒体数据归档
操作流程
- 确认运行环境满足依赖说明中的要求
- 根据适用场景选择合适的使用方式
- 执行操作并检查输出结果
- 如遇错误,参考错误处理章节
输入规范
| 参数名 | 类型 | 必填 | 说明 | |---:|---:|---:|---:| | channel_id | string | 是 | Discord频道ID | | query | string | 否 | 搜索关键词, 默认: 全部消息 |
结果格式
{
"success": true,
"data": {
"overall_grade": "A",
"total_score": 92,
"max_score": 100,
"summary": "处理完成",
"details": [
{
"item": "代码风格",
"status": "pass",
"score": 95,
"comment": "符合规范"
},
{
"item": "安全合规",
"status": "warn",
"score": 80,
"comment": "符合规范"
}
],
"improvements": [
{
"priority": "high",
"suggestion": "建议优化",
"expected_gain": "+5分"
},
{
"priority": "medium",
"suggestion": "建议优化",
"expected_gain": "+3分"
}
]
},
"error": null
}
环境要求
运行环境
- Agent平台: 支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
- 操作系统: Windows / macOS / Linux
工具依赖
| 依赖项 | 类型 | 是否必需 | 获取方式 | |:---:|:---:|:---:|:---:| | LLM API | API | 必需 | 由Agent内置LLM提供 |
API Key 配置
可用性分类
- 分类: MD+execute()
- 说明: 基于Markdown的AI Skill,
API Key配置方式:
export API_KEY="${API_KEY:?请设置环境变量}"
配置后需重启会话或开启新终端生效。API Key应妥善保管,避免泄露到版本控制系统.
异常处置
| 错误场景 | 原因 | 处理方式 | |:------|------:|:------| | LLM响应超时或无响应 | 网络延迟或模型负载过高 | 请求重试;确认Agent平台LLM服务正常 | | 输入内容格式不正确 | 用户输入不符合skill预期格式 | 检查输入是否符合skill使用说明中的格式要求,参考示例章节 | | 执行结果与预期不符 | 指令描述不够明确或上下文不足 | 提供更详细的指令描述,补充必要的上下文信息 | | 命令执行失败 | 运行环境不满足要求或权限不足 | 确认运行环境符合依赖说明中的要求;检查命令权限设置 |
注意事项
- 需要API Key,无Key环境无法使用
创新优势
效率提升量化分析
| 操作步骤 | 手动耗时 | 自动化耗时 | 时间节约 | 准确率提升 | | --- | --- | --- | --- | --- | | 爬取大量网页 | 8小时 | 2小时 | 6小时 | 10% | | 数据清洗 | 4小时 | 1小时 | 3小时 | 5% | | 数据分析 | 6小时 | 1.5小时 | 4.5小时 | 8% | | 数据可视化 | 3小时 | 0.5小时 | 2.5小时 | 7% | | 报告生成 | 2小时 | 0.5小时 | 1.5小时 | 6% |
差异化对比
| 对比维度 | 本技能 | 手动操作 | Python脚本 | 专业软件 | | --- | --- | --- | --- | --- | | 界面友好度 | 高 | 低 | 中 | 高 | | 功能丰富性 | 高 | 低 | 中 | 高 | | 易用性 | 高 | 低 | 中 | 高 | | 扩展性 | 高 | 低 | 中 | 高 | | 成本 | 低 | 高 | 中 | 高 |
核心痛点解决
| 痛点 | 描述 | 影响范围 | 解决方案 | 量化效果 | | --- | --- | --- | --- | --- | | 网页数据抓取效率低 | 手动抓取数据耗时且容易出错 | 影响数据分析效率 | 自动化抓取,提高效率 | 时间节约50% | | 数据清洗难度大 | 数据格式多样,清洗工作繁重 | 影响数据分析准确性 | 提供自动化清洗工具 | 准确率提升10% | | 数据分析复杂 | 分析过程复杂,需要专业技能 | 影响决策效率 | 提供可视化分析工具 | 决策效率提升20% |
常见问题FAQ
Q1: 如何配置API Key?
A: 在依赖说明中找到API Key配置方式,按照指示设置API Key,并确保重启会话或开启新终端后生效。
Q2: 付费版与免费版有什么区别?
A: 付费版提供多标签页并行抓取、反爬虫策略自动绕过、页面结构变化自适应、批量导出结构化数据、Cookie池管理与IP轮换等高级功能。
Q3: 支持哪些类型的网页爬取?
A: 支持Discord平台的归档搜索、同步新鲜度、私信、频道切片和SQL计数等功能。
Q4: 如何处理反爬虫策略?
A: 付费版提供自动绕过反爬虫策略的功能,可以更高效地抓取数据。
Q5: 如何查看输出结果?
A: 在AI Agent对话中调用本技能后,可以直接查看输出结果,并根据需要进行后续处理。
问题处理指引
| 错误现象 | 可能原因 | 诊断步骤 | 解决方案 | | --- | --- | --- | --- | | 无法启动工具 | 运行环境不满足要求 | 检查运行环境是否符合依赖说明中的要求 | 确保操作系统和Agent平台支持 | | 抓取数据失败 | 网络连接问题 | 检查网络连接是否正常 | 检查网络连接,确保数据传输畅通 | | 输出结果错误 | 输入参数错误 | 检查输入参数是否符合格式要求 | 仔细阅读输入格式说明,确保参数正确 | | 执行速度慢 | 系统资源不足 | 检查系统资源使用情况 | 优化系统资源,提高执行速度 | | 报错信息不明确 | 缺乏错误处理机制 | 查看错误日志,分析错误信息 | 优化错误处理机制,提供更详细的错误信息 |
安全规范
- 确保API Key安全,避免泄露到版本控制系统。
- 遵守网站爬虫协议,尊重网站版权和隐私政策。
- 避免过度抓取,以免对目标网站造成过大压力。
- 定期更新工具,以修复已知的安全漏洞。
- 在处理敏感数据时,确保数据加密和传输安全。
安全风险防范
| 风险项 | 等级 | 防护措施 | 验证方法 | | --- | --- | --- | --- | | API密钥泄露 | 高 | 通过环境变量配置,禁止硬编码 | 定期检查代码和配置文件 | | 命令执行风险 | 高 | 仅执行白名单命令,避免拼接用户输入 | 使用沙箱环境测试 | | 网络通信安全 | 中 | 使用HTTPS协议,验证SSL证书 | 定期检查证书有效期 | | 敏感数据暴露 | 高 | 输出结果中不包含密钥、令牌等敏感信息 | 日志脱敏审查 | | 未授权访问 | 中 | 限制访问权限,实施认证机制 | 定期审计访问日志 |
主要功能
- 自动化执行: Discord归档,搜索/同步新鲜度/私信/频道切片/SQL计数。Discord archive: search, sy
- 文件处理: 支持多种文件格式的读取、解析和写入操作
- API集成: 通过标准化接口调用外部服务并处理响应
- 命令执行: 在安全沙箱中执行系统命令并收集结果
- 信息检索: 快速搜索和过滤目标数据
故障处理方案
针对"网页爬取工具"使用中可能遇到的常见问题,提供以下排查方案:
| 错误类型 | 原因分析 | 解决方案 | |---------|---------|---------| | API认证失败(401) | API密钥错误或过期 | 检查密钥配置,重新生成token | | 接口限流(429) | 请求频率超出限制 | 降低调用频率,启用重试退避策略 | | 响应超时(504) | 网络延迟或服务端负载过高 | 增加超时阈值,检查网络连接 | | 文件不存在 | 路径错误或文件未创建 | 检查路径拼写,确认文件已生成 | | 文件格式不支持 | 扩展名不在支持列表中 | 转换为支持的格式后重试 | | 权限不足 | 当前用户无读写权限 | 检查文件权限,以管理员身份运行 | | 命令执行失败 | 参数错误或环境依赖缺失 | 检查命令语法,确认依赖已安装 | | 进程超时 | 命令执行时间过长 | 增加超时设置,优化命令参数 | | 网络连接失败 | DNS解析失败或防火墙拦截 | 检查网络配置,确认代理设置 |
"网页爬取工具"通用排查步骤
- 检查输入参数: 确认所有必填参数已提供且格式正确
- 查看日志输出: 定位具体错误行和异常类型
- 验证环境配置: 确认依赖库版本和运行环境满足要求
- 逐步调试: 缩小问题范围,隔离故障模块
启动指引
- 配置API密钥: 在环境变量中设置对应的API Key
- 初始化连接: 使用提供的凭证建立API连接
- 调用接口: 传入必要参数执行API调用
- 准备文件: 确认文件路径正确且格式受支持
- 执行处理: 调用对应的处理函数
- 查看结果: 检查输出文件或返回数据
- 检查环境: 确认运行时和依赖已安装
- 执行命令: 使用正确的参数格式执行
- 查看输出: 检查命令输出和退出码
前置条件
- 已安装所需运行环境(参考依赖说明)
- 已获取必要的API密钥或访问凭证(如适用)
- 输入数据已准备就绪
依赖说明
运行环境
- Agent 平台: 支持SKILL.md的任意AI Agent
- 操作系统: Windows / macOS / Linux
可用性分类
- 分类: MD(纯Markdown指令,通过自然语言驱动Agent完成操作)
- 说明: 基于Markdown的AI Skill,通过自然语言指令驱动Agent完成操作。
Scan to join WeChat group