返回 Skill 列表
extension
分类: 数据与分析无需 API Key

轻量统计分析

对 CSV/Excel 数据做描述统计与相关分析,一行命令出结果。当用户说「帮我看这组数据的基本统计」「两列相关性强不强」「做个 t 检验」时使用。基于 pingouin(依赖 numpy/scipy/pandas,均为标准科学计算栈,无 torch 重依赖)。

person作者: user_8170ea13hubcommunity

轻量统计分析

骨架版(v0.1.0):核心脚本与单测已就绪,后续按文末「完善清单」逐技能打磨提示词与边界。

概述

把最常见的统计动作变成一句话命令:均值方差分布、两变量相关性。适合先快速摸数据再决定是否上重模型。

何时使用

  • 快速看数据分布与基本统计
  • 判断两列变量是否相关
  • 报告前的探索性分析

快速使用

# 描述统计(整表或某列)
python3 scripts/stats_helper.py describe 数据.xlsx -c 销售额

# 两列相关(Pearson)
python3 scripts/stats_helper.py corr 数据.xlsx 广告费 销售额

依赖安装

# 提示:脚本用相对路径 scripts/,请先 cd 到本技能目录再运行
python3 -m pip install pingouin pandas

常见错误 / 注意

  • 依赖 scipy/numpy/pandas,安装体积适中但非重 ML 框架
  • 当前骨架含 describe/corr,后续可加 ttest/anova/回归
  • 中文列名需源文件编码为 UTF-8

实测验证(v0.1.0)

  • 核心依赖pingouin
  • 安装体积:🔴 383.4 MB(依赖闭包实测,重量级)
  • 环境要求:依赖 scipy / statsmodels / scikit-learn / pandas,安装体积最大(约 383MB),但纯 CPU 无 GPU 要求。
  • 单元测试python3 -m unittest tests.test_...(须 cd 到本技能目录运行)
  • CLI 冒烟:已通过端到端实测

已验证行为

  • ✅ describe:描述统计
  • ✅ corr:相关性(含 p 值与置信区间)
  • ✅ normality:Shapiro-Wilk 正态性检验
  • ✅ ttest:t 检验(含 Cohen's d 效应量)

已知边界 / 坑

  • ⚠️ pingouin 没有 describe(),描述统计由 pandas 提供,推断统计才用 pingouin
  • ⚠️ 样本量 ≤4 时 power 估计返回 NaN,属正常告警

完善清单(骨架后待补齐)

  • [ ] 补充更丰富的示例与边界处理
  • [ ] 增加批量 / 多格式模式
  • [ ] 写更完整的自测说明与示例文件
  • [ ] 打磨触发词与用户引导话术(对齐本生态其他技能风格)