轻量统计分析
骨架版(v0.1.0):核心脚本与单测已就绪,后续按文末「完善清单」逐技能打磨提示词与边界。
概述
把最常见的统计动作变成一句话命令:均值方差分布、两变量相关性。适合先快速摸数据再决定是否上重模型。
何时使用
- 快速看数据分布与基本统计
- 判断两列变量是否相关
- 报告前的探索性分析
快速使用
# 描述统计(整表或某列)
python3 scripts/stats_helper.py describe 数据.xlsx -c 销售额
# 两列相关(Pearson)
python3 scripts/stats_helper.py corr 数据.xlsx 广告费 销售额
依赖安装
# 提示:脚本用相对路径 scripts/,请先 cd 到本技能目录再运行
python3 -m pip install pingouin pandas
常见错误 / 注意
- 依赖 scipy/numpy/pandas,安装体积适中但非重 ML 框架
- 当前骨架含 describe/corr,后续可加 ttest/anova/回归
- 中文列名需源文件编码为 UTF-8
实测验证(v0.1.0)
- 核心依赖:
pingouin - 安装体积:🔴 383.4 MB(依赖闭包实测,重量级)
- 环境要求:依赖 scipy / statsmodels / scikit-learn / pandas,安装体积最大(约 383MB),但纯 CPU 无 GPU 要求。
- 单元测试:
python3 -m unittest tests.test_...(须 cd 到本技能目录运行) - CLI 冒烟:已通过端到端实测
已验证行为
- ✅ describe:描述统计
- ✅ corr:相关性(含 p 值与置信区间)
- ✅ normality:Shapiro-Wilk 正态性检验
- ✅ ttest:t 检验(含 Cohen's d 效应量)
已知边界 / 坑
- ⚠️ pingouin 没有 describe(),描述统计由 pandas 提供,推断统计才用 pingouin
- ⚠️ 样本量 ≤4 时 power 估计返回 NaN,属正常告警
完善清单(骨架后待补齐)
- [ ] 补充更丰富的示例与边界处理
- [ ] 增加批量 / 多格式模式
- [ ] 写更完整的自测说明与示例文件
- [ ] 打磨触发词与用户引导话术(对齐本生态其他技能风格)
微信扫一扫