数据分析|潜类别分析(备选)
1. 任务定位
本 Skill 专门完成“潜类别分析”,服务于“数据分析”工作流。清单给出的任务目标是:用于完成“潜类别分析”任务的通用工作流。使用 OLS、GLM、混合模型和 ARIMA 等统计模型,并进行诊断与推断。
本地设计原则:只有在首选路径不适用或存在明确差异时启用,并说明差异和代价。
2. 何时启用
当用户明确提出“潜类别分析”,并提供研究对象、材料或可执行目标时启用。若请求同时包含多个任务,先拆分并说明本 Skill 只负责哪一部分。
3. 输入契约
- 必填:任务目标、研究对象/材料范围、期望交付物。
- 视任务需要:研究问题、方法、样本、时间范围、软件/版本、格式、伦理和版权约束。
- 若输入缺失:先列出最小缺口;可以继续的部分与待确认部分分开,不用猜测补齐事实。
4. 独立执行流程
- 先定义研究问题、分析单位、核心概念、目标参数或解释目标。
- 把样本、变量、测量、识别逻辑、分析步骤和预设检验写成可执行方案。
- 提前列出替代解释、失败条件、稳健性检验和不能由设计回答的问题。
- 固定因变量、解释变量、估计对象、样本过滤和基准设定。
- 检查分布、缺失、共线性、残差/拟合、标准误和设定敏感性。
阶段 A:界定
把用户目标转换为“对象—动作—标准—交付物”,记录范围、假设和停止条件。任何超出“潜类别分析”的动作都作为后续建议,不自动执行。
阶段 B:处理
按上面的任务步骤执行。优先保留原始材料和中间结果;需要调用工具时记录工具、版本、关键参数、输入范围和输出位置。
阶段 C:交付
- 模型设定表、估计结果、诊断、稳健性比较和解释边界。
5. 质量门禁
-
研究问题、设计、数据和结论强度相互匹配。
-
关键假设、测量误差、样本限制和风险均有记录。
-
另一位研究者可以根据交付物复核设计决策。
-
报告效应大小和不确定性,不以单一显著性替代判断。
-
[ ] 所有核心结论都能回到输入材料、计算结果或明确标记的推断。
-
[ ] 关键数字、术语、版本、路径、引用和格式已抽查。
-
[ ] 原始材料、中间处理、最终交付物之间可相互追踪。
-
[ ] 没有未经授权的上传、发送、发布、安装、删除或账号操作。
6. 工具与失败处理
本地工具选择原则:根据当前环境的可用能力和任务约束选择工具,不依赖原始来源的实现或命令。
- 工具不可用:说明影响,切换到可验证的替代方法,并记录差异。
- 数据不足、格式错误或结果冲突:保留错误样本,输出缺口和修复建议,不伪造完成。
- 外部联网、第三方材料或敏感数据:先确认权限、来源、许可和最小化范围。
- 需要写入文件时:使用稳定文件名,保留版本和来源记录;仅写入用户指定范围。
7. 本地化边界
本文件是独立设计的执行契约;最终包不包含第三方源文件、第三方代码或第三方运行指令。来源审计信息留在工作区归档中,不作为本 Skill 的运行指令。
8. 自有 Python 实现
本 Skill 的自有实现用于本地数据诊断、统计摘要和方法前置检查,仅处理已授权的本地输入,不执行来源仓库代码、不默认联网、不上传数据。
- 入口:
code/analysis.py - 输入:JSON 数组或包含
records数组的 JSON 文件。 - 输出:任务对应的结构化结果、无效记录、限制和审计信息。
- 运行:
python code/analysis.py --input input.json --output result.json - 开发测试已在项目工作区完成;测试文件不随最终 Skill 包提供。
任务专属实现:潜类别分析。
微信扫一扫