返回 Skill 列表
extension
分类: 数据与分析需要 API Key

Discrawl

Discord归档,搜索/同步新鲜度/私信/频道切片/SQL计数。Discord archive: search, sync freshness,

person作者: u_d197a013hubenterprise

核心功能: 本技能提供中文交互、、排名提升、搜索流量优化时使用、、关键词分析、排名提升、搜索流量优化时使用、化工作流场景等能力。

Discrawl

付费版扩展能力

| 能力 | 免费版 | 付费版 | |---|---|---| | 基础功能 | 支持 | 支持 | | 多标签页并行抓取 | 不支持 | 支持 | | 反爬虫策略自动绕过 | 不支持 | 支持 | | 页面结构变化自适应 | 不支持 | 支持 | | 批量导出结构化数据 | 不支持 | 支持 | | Cookie池管理与IP轮换 | 不支持 | 支持 |

能力一览

  • Discord archive: search, sync freshness, DMs, channel slices, SQL counts

场景示例

| 场景 | 输入 | 输出 | |:-----|:-----|:-----| | Discord归档搜索 | 频道ID和搜索关键词 | 匹配消息列表和元数据 | | 新鲜度同步 | 频道和最后同步时间 | 增量更新的消息记录 | | DM和频道切片 | 用户ID或频道范围 | 消息切片和SQL统计 |

不适用于:非Discord平台的社媒体数据归档

操作流程

  1. 确认运行环境满足依赖说明中的要求
  2. 根据适用场景选择合适的使用方式
  3. 执行操作并检查输出结果
  4. 如遇错误,参考错误处理章节

输入规范

| 参数名 | 类型 | 必填 | 说明 | |---:|---:|---:|---:| | channel_id | string | 是 | Discord频道ID | | query | string | 否 | 搜索关键词, 默认: 全部消息 |

结果格式

{
  "success": true,
  "data": {
    "overall_grade": "A",
    "total_score": 92,
    "max_score": 100,
    "summary": "处理完成",
    "details": [
      {
        "item": "代码风格",
        "status": "pass",
        "score": 95,
        "comment": "符合规范"
      },
      {
        "item": "安全合规",
        "status": "warn",
        "score": 80,
        "comment": "符合规范"
      }
    ],
    "improvements": [
      {
        "priority": "high",
        "suggestion": "建议优化",
        "expected_gain": "+5分"
      },
      {
        "priority": "medium",
        "suggestion": "建议优化",
        "expected_gain": "+3分"
      }
    ]
  },
  "error": null
}

环境要求

运行环境

  • Agent平台: 支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
  • 操作系统: Windows / macOS / Linux

工具依赖

| 依赖项 | 类型 | 是否必需 | 获取方式 | |:---:|:---:|:---:|:---:| | LLM API | API | 必需 | 由Agent内置LLM提供 |

API Key 配置

可用性分类

  • 分类: MD+execute()
  • 说明: 基于Markdown的AI Skill,

API Key配置方式:

export API_KEY="${API_KEY:?请设置环境变量}"

配置后需重启会话或开启新终端生效。API Key应妥善保管,避免泄露到版本控制系统.

异常处置

| 错误场景 | 原因 | 处理方式 | |:------|------:|:------| | LLM响应超时或无响应 | 网络延迟或模型负载过高 | 请求重试;确认Agent平台LLM服务正常 | | 输入内容格式不正确 | 用户输入不符合skill预期格式 | 检查输入是否符合skill使用说明中的格式要求,参考示例章节 | | 执行结果与预期不符 | 指令描述不够明确或上下文不足 | 提供更详细的指令描述,补充必要的上下文信息 | | 命令执行失败 | 运行环境不满足要求或权限不足 | 确认运行环境符合依赖说明中的要求;检查命令权限设置 |

注意事项

  • 需要API Key,无Key环境无法使用

创新优势

效率提升量化分析

| 操作步骤 | 手动耗时 | 自动化耗时 | 时间节约 | 准确率提升 | | --- | --- | --- | --- | --- | | 爬取大量网页 | 8小时 | 2小时 | 6小时 | 10% | | 数据清洗 | 4小时 | 1小时 | 3小时 | 5% | | 数据分析 | 6小时 | 1.5小时 | 4.5小时 | 8% | | 数据可视化 | 3小时 | 0.5小时 | 2.5小时 | 7% | | 报告生成 | 2小时 | 0.5小时 | 1.5小时 | 6% |

差异化对比

| 对比维度 | 本技能 | 手动操作 | Python脚本 | 专业软件 | | --- | --- | --- | --- | --- | | 界面友好度 | 高 | 低 | 中 | 高 | | 功能丰富性 | 高 | 低 | 中 | 高 | | 易用性 | 高 | 低 | 中 | 高 | | 扩展性 | 高 | 低 | 中 | 高 | | 成本 | 低 | 高 | 中 | 高 |

核心痛点解决

| 痛点 | 描述 | 影响范围 | 解决方案 | 量化效果 | | --- | --- | --- | --- | --- | | 网页数据抓取效率低 | 手动抓取数据耗时且容易出错 | 影响数据分析效率 | 自动化抓取,提高效率 | 时间节约50% | | 数据清洗难度大 | 数据格式多样,清洗工作繁重 | 影响数据分析准确性 | 提供自动化清洗工具 | 准确率提升10% | | 数据分析复杂 | 分析过程复杂,需要专业技能 | 影响决策效率 | 提供可视化分析工具 | 决策效率提升20% |

常见问题FAQ

Q1: 如何配置API Key?

A: 在依赖说明中找到API Key配置方式,按照指示设置API Key,并确保重启会话或开启新终端后生效。

Q2: 付费版与免费版有什么区别?

A: 付费版提供多标签页并行抓取、反爬虫策略自动绕过、页面结构变化自适应、批量导出结构化数据、Cookie池管理与IP轮换等高级功能。

Q3: 支持哪些类型的网页爬取?

A: 支持Discord平台的归档搜索、同步新鲜度、私信、频道切片和SQL计数等功能。

Q4: 如何处理反爬虫策略?

A: 付费版提供自动绕过反爬虫策略的功能,可以更高效地抓取数据。

Q5: 如何查看输出结果?

A: 在AI Agent对话中调用本技能后,可以直接查看输出结果,并根据需要进行后续处理。

问题处理指引

| 错误现象 | 可能原因 | 诊断步骤 | 解决方案 | | --- | --- | --- | --- | | 无法启动工具 | 运行环境不满足要求 | 检查运行环境是否符合依赖说明中的要求 | 确保操作系统和Agent平台支持 | | 抓取数据失败 | 网络连接问题 | 检查网络连接是否正常 | 检查网络连接,确保数据传输畅通 | | 输出结果错误 | 输入参数错误 | 检查输入参数是否符合格式要求 | 仔细阅读输入格式说明,确保参数正确 | | 执行速度慢 | 系统资源不足 | 检查系统资源使用情况 | 优化系统资源,提高执行速度 | | 报错信息不明确 | 缺乏错误处理机制 | 查看错误日志,分析错误信息 | 优化错误处理机制,提供更详细的错误信息 |

安全规范

  1. 确保API Key安全,避免泄露到版本控制系统。
  2. 遵守网站爬虫协议,尊重网站版权和隐私政策。
  3. 避免过度抓取,以免对目标网站造成过大压力。
  4. 定期更新工具,以修复已知的安全漏洞。
  5. 在处理敏感数据时,确保数据加密和传输安全。

安全风险防范

| 风险项 | 等级 | 防护措施 | 验证方法 | | --- | --- | --- | --- | | API密钥泄露 | 高 | 通过环境变量配置,禁止硬编码 | 定期检查代码和配置文件 | | 命令执行风险 | 高 | 仅执行白名单命令,避免拼接用户输入 | 使用沙箱环境测试 | | 网络通信安全 | 中 | 使用HTTPS协议,验证SSL证书 | 定期检查证书有效期 | | 敏感数据暴露 | 高 | 输出结果中不包含密钥、令牌等敏感信息 | 日志脱敏审查 | | 未授权访问 | 中 | 限制访问权限,实施认证机制 | 定期审计访问日志 |

主要功能

  • 自动化执行: Discord归档,搜索/同步新鲜度/私信/频道切片/SQL计数。Discord archive: search, sy
  • 文件处理: 支持多种文件格式的读取、解析和写入操作
  • API集成: 通过标准化接口调用外部服务并处理响应
  • 命令执行: 在安全沙箱中执行系统命令并收集结果
  • 信息检索: 快速搜索和过滤目标数据

故障处理方案

针对"网页爬取工具"使用中可能遇到的常见问题,提供以下排查方案:

| 错误类型 | 原因分析 | 解决方案 | |---------|---------|---------| | API认证失败(401) | API密钥错误或过期 | 检查密钥配置,重新生成token | | 接口限流(429) | 请求频率超出限制 | 降低调用频率,启用重试退避策略 | | 响应超时(504) | 网络延迟或服务端负载过高 | 增加超时阈值,检查网络连接 | | 文件不存在 | 路径错误或文件未创建 | 检查路径拼写,确认文件已生成 | | 文件格式不支持 | 扩展名不在支持列表中 | 转换为支持的格式后重试 | | 权限不足 | 当前用户无读写权限 | 检查文件权限,以管理员身份运行 | | 命令执行失败 | 参数错误或环境依赖缺失 | 检查命令语法,确认依赖已安装 | | 进程超时 | 命令执行时间过长 | 增加超时设置,优化命令参数 | | 网络连接失败 | DNS解析失败或防火墙拦截 | 检查网络配置,确认代理设置 |

"网页爬取工具"通用排查步骤

  1. 检查输入参数: 确认所有必填参数已提供且格式正确
  2. 查看日志输出: 定位具体错误行和异常类型
  3. 验证环境配置: 确认依赖库版本和运行环境满足要求
  4. 逐步调试: 缩小问题范围,隔离故障模块

启动指引

  1. 配置API密钥: 在环境变量中设置对应的API Key
  2. 初始化连接: 使用提供的凭证建立API连接
  3. 调用接口: 传入必要参数执行API调用
  4. 准备文件: 确认文件路径正确且格式受支持
  5. 执行处理: 调用对应的处理函数
  6. 查看结果: 检查输出文件或返回数据
  7. 检查环境: 确认运行时和依赖已安装
  8. 执行命令: 使用正确的参数格式执行
  9. 查看输出: 检查命令输出和退出码

前置条件

  • 已安装所需运行环境(参考依赖说明)
  • 已获取必要的API密钥或访问凭证(如适用)
  • 输入数据已准备就绪

依赖说明

运行环境

  • Agent 平台: 支持SKILL.md的任意AI Agent
  • 操作系统: Windows / macOS / Linux

可用性分类

  • 分类: MD(纯Markdown指令,通过自然语言驱动Agent完成操作)
  • 说明: 基于Markdown的AI Skill,通过自然语言指令驱动Agent完成操作。