数据采集|社交媒体数据采集(首选)
1. 任务定位
本 Skill 专门完成“社交媒体数据采集”,服务于“数据采集”工作流。清单给出的任务目标是:设计和审计可用于决策的分析埋点系统。
本地设计原则:作为该分类的默认路径;先完成任务拆解,再输出一套可复核的主方案。
2. 何时启用
当用户明确提出“社交媒体数据采集”,并提供研究对象、材料或可执行目标时启用。若请求同时包含多个任务,先拆分并说明本 Skill 只负责哪一部分。
3. 输入契约
- 必填:任务目标、研究对象/材料范围、期望交付物。
- 视任务需要:研究问题、方法、样本、时间范围、软件/版本、格式、伦理和版权约束。
- 若输入缺失:先列出最小缺口;可以继续的部分与待确认部分分开,不用猜测补齐事实。
4. 独立执行流程
- 先固定目标总体、采集单位、字段字典、版本、许可和质量阈值。
- 用小样本验证采集工具、字段映射、失败处理和重复规则,再扩大范围。
- 原始文件只读保存,逐批记录来源、时间、覆盖率、失败样本和抽查结果。
阶段 A:界定
把用户目标转换为“对象—动作—标准—交付物”,记录范围、假设和停止条件。任何超出“社交媒体数据采集”的动作都作为后续建议,不自动执行。
阶段 B:处理
按上面的任务步骤执行。优先保留原始材料和中间结果;需要调用工具时记录工具、版本、关键参数、输入范围和输出位置。
阶段 C:交付
- 与本任务直接对应的工作成果、依据、限制、待核验项和下一步行动。
5. 质量门禁
-
采集范围、字段来源、失败率和抽查准确率可追踪。
-
重复、缺失、转写或抓取误差有明确处理规则。
-
隐私、伦理、版权和服务条款限制已单独标注。
-
[ ] 所有核心结论都能回到输入材料、计算结果或明确标记的推断。
-
[ ] 关键数字、术语、版本、路径、引用和格式已抽查。
-
[ ] 原始材料、中间处理、最终交付物之间可相互追踪。
-
[ ] 没有未经授权的上传、发送、发布、安装、删除或账号操作。
6. 工具与失败处理
本地工具选择原则:根据当前环境的可用能力和任务约束选择工具,不依赖原始来源的实现或命令。
- 工具不可用:说明影响,切换到可验证的替代方法,并记录差异。
- 数据不足、格式错误或结果冲突:保留错误样本,输出缺口和修复建议,不伪造完成。
- 外部联网、第三方材料或敏感数据:先确认权限、来源、许可和最小化范围。
- 需要写入文件时:使用稳定文件名,保留版本和来源记录;仅写入用户指定范围。
7. 本地化边界
本文件是独立设计的执行契约;最终包不包含第三方源文件、第三方代码或第三方运行指令。来源审计信息留在工作区归档中,不作为本 Skill 的运行指令。
8. 自有 Python 实现
本 Skill 的本地实现是离线采集台账与质量门禁,不自动访问外部网站、不上传数据,也不执行来源仓库中的代码。
- 入口:
code/collector.py - 输入:包含
records数组的 JSON 文件,或直接的 JSON 数组。 - 输出:逐条记录的必填字段、重复键、无效样本和通过样本审计报告。
- 运行:
python code/collector.py --input input.json --output audit.json - 开发测试已在项目工作区完成;测试文件不随最终 Skill 包提供。
该实现只处理本地已授权材料;联网采集、登录、绕过限制和向第三方发送数据不属于本 Skill 的默认行为。
微信扫一扫