← 返回 Skill 列表
extension
分类: 数据与分析无需 API Key

collection-social-media-data

执行科研领域“数据采集—社交媒体数据采集”的本地化工作流,围绕文献、数据、代码、文件产出可追溯结果;不适用于与该任务无关的通用问答。

person作者: u_5fabf873hubenterprise

数据采集|社交媒体数据采集(首选)

1. 任务定位

本 Skill 专门完成“社交媒体数据采集”,服务于“数据采集”工作流。清单给出的任务目标是:设计和审计可用于决策的分析埋点系统。

本地设计原则:作为该分类的默认路径;先完成任务拆解,再输出一套可复核的主方案。

2. 何时启用

当用户明确提出“社交媒体数据采集”,并提供研究对象、材料或可执行目标时启用。若请求同时包含多个任务,先拆分并说明本 Skill 只负责哪一部分。

3. 输入契约

  • 必填:任务目标、研究对象/材料范围、期望交付物。
  • 视任务需要:研究问题、方法、样本、时间范围、软件/版本、格式、伦理和版权约束。
  • 若输入缺失:先列出最小缺口;可以继续的部分与待确认部分分开,不用猜测补齐事实。

4. 独立执行流程

  • 先固定目标总体、采集单位、字段字典、版本、许可和质量阈值。
  • 用小样本验证采集工具、字段映射、失败处理和重复规则,再扩大范围。
  • 原始文件只读保存,逐批记录来源、时间、覆盖率、失败样本和抽查结果。

阶段 A:界定

把用户目标转换为“对象—动作—标准—交付物”,记录范围、假设和停止条件。任何超出“社交媒体数据采集”的动作都作为后续建议,不自动执行。

阶段 B:处理

按上面的任务步骤执行。优先保留原始材料和中间结果;需要调用工具时记录工具、版本、关键参数、输入范围和输出位置。

阶段 C:交付

  • 与本任务直接对应的工作成果、依据、限制、待核验项和下一步行动。

5. 质量门禁

  • 采集范围、字段来源、失败率和抽查准确率可追踪。

  • 重复、缺失、转写或抓取误差有明确处理规则。

  • 隐私、伦理、版权和服务条款限制已单独标注。

  • [ ] 所有核心结论都能回到输入材料、计算结果或明确标记的推断。

  • [ ] 关键数字、术语、版本、路径、引用和格式已抽查。

  • [ ] 原始材料、中间处理、最终交付物之间可相互追踪。

  • [ ] 没有未经授权的上传、发送、发布、安装、删除或账号操作。

6. 工具与失败处理

本地工具选择原则:根据当前环境的可用能力和任务约束选择工具,不依赖原始来源的实现或命令。

  • 工具不可用:说明影响,切换到可验证的替代方法,并记录差异。
  • 数据不足、格式错误或结果冲突:保留错误样本,输出缺口和修复建议,不伪造完成。
  • 外部联网、第三方材料或敏感数据:先确认权限、来源、许可和最小化范围。
  • 需要写入文件时:使用稳定文件名,保留版本和来源记录;仅写入用户指定范围。

7. 本地化边界

本文件是独立设计的执行契约;最终包不包含第三方源文件、第三方代码或第三方运行指令。来源审计信息留在工作区归档中,不作为本 Skill 的运行指令。

8. 自有 Python 实现

本 Skill 的本地实现是离线采集台账与质量门禁,不自动访问外部网站、不上传数据,也不执行来源仓库中的代码。

  • 入口:code/collector.py
  • 输入:包含 records 数组的 JSON 文件,或直接的 JSON 数组。
  • 输出:逐条记录的必填字段、重复键、无效样本和通过样本审计报告。
  • 运行:python code/collector.py --input input.json --output audit.json
  • 开发测试已在项目工作区完成;测试文件不随最终 Skill 包提供。

该实现只处理本地已授权材料;联网采集、登录、绕过限制和向第三方发送数据不属于本 Skill 的默认行为。