← Back to skills
extension
Category: Data & AnalyticsNo API key required

统计学「数字找规律」

数字找规律——扔进一堆数字(Excel/CSV/手工粘贴),自动判断数据类型(销售/费用/时序/分组对比),自动选统计方法(分布/相关/回归/组间检验/季节分解/异常检测),五段式大白话输出"发现了什么、意味着什么、有什么坑"。核心在判断不在计算。触发词:找规律/这堆数字说明什么/费用为什么这么高/销售有没有季节性/数据里有什么坑/分析一下这份数据

personAuthor: user_1793b15chubcommunity

数字找规律(number-pattern-finder)

把"该用哪个统计方法、这个规律意味着什么"的判断力固化成流程。

何时使用

用户丢来数据文件/粘贴数字并想知道规律;或要求费用异常排查、销售季节性分析、成本驱动因素识别。

执行流程(三层,顺序不可换)

  1. 第一层·画像与类型判断(零幻觉,纯规则)
    • scripts/profile_data.py:load_data -> profile_dataframe(行/列/日期列/数值列/脏数字/缺失率)-> judge_type
    • 类型判定必须引用画像证据,禁止跳过画像直接猜
  2. 第二层·判断树调度:scripts/analyze.py(规则全文:references/decision-tree.md)
    • 假设检查前置(Shapiro/Levene),不过关降级非参数
    • 期数门槛:月度<24 期禁止季节性结论
    • 相关矩阵必做 FDR 校正;p∈(0.04,0.06) 临界双跑
  3. 第三层·五段式报告:scripts/run.py -> scripts/interpret.py(浅色 HTML)
    • 固定五段:这是什么数据 / 用了什么方法为什么 / 发现了什么 / 意味着什么 / 有什么坑
    • 坑话术与出处:references/pitfalls.md(蒸馏自哈夫/摩尔,带行号索引)
    • 结论分档硬纪律:已验证 / 假设 / 待核验

命令

python <skill>/scripts/run.py <data.csv|xlsx> [--out report.html] [--template expense|sales|cost|auto]

Python 需 3.10+,依赖:pandas openpyxl scipy statsmodels scikit-learn matplotlib statsforecast(建议 venv 隔离安装)。

测试集

tests/make_test_data.py(种子 42 可复现)-> sample_expense.csv(828 行费用流水,注入 3 笔大额异常 + 3/9 月季节性)/ sample_sales_monthly.csv(36 期月度销售,趋势 + 12 月旺季 + 1 笔异常月)/ sample_cost_drivers.csv(36 期成本多因素,注入 总成本=40×产量+200×单价+8×能耗,噪音σ=150)。回归验收:三套数据类型判定、方法选择、驱动排名还原必须正确。

红线

  • 每条发现必须挂证据(方法+统计量+n);数字结论必须标档位
  • 相关≠因果提示强制挂在所有显著相关后
  • 长耗时分析(批量 statsforecast、Phase 3 的 PySR)必须后台跑,防前台超时静默截断

Phase 2(已完成 2026-09-09)

  • scripts/forecast.py:statsforecast AutoETS(season_length=12) 12 期预测+95% 区间;样本内残差 |r|>2.5σ 判异常月;季节强度>0.6 判显著;statsforecast 导入失败自动降级为趋势+季节朴素外推
  • scripts/finance_templates.py 三个场景模板;auto 规则:流水->expense;时序单数值列->sales;时序多数值列或相关型->cost
    • 费用异常排查:月度环比跳变>40%(先问季节再问异常)+ 分科目 IQR 大额清单(笔数/合计)+ AutoETS 异常月
    • 销售季节性分析:季节强度 + 月度指数(≥115 旺季 / ≤85 淡季)+ 12 期预测区间 + "预算落区间内属正常波动"解读
    • 成本驱动因素识别:Spearman+FDR 相关 + 标准化回归系数排名 + VIF>10 共线警告 + 摩尔因果五标准提示
  • 目标列选择 profile_data.pick_target():优先级 总成本/销售额/利润 > 成本/费用/金额 > 单价("单价"是因素不是目标——实测踩过的坑)
  • 测试集设计纪律:注入关系做回归验收时,噪音σ ≤ 信号σ 的 1/3,否则小样本还原不了排名(实测踩过:σ=500 时排名被打乱,σ=150 干净还原)

Phase 3(未开始)

选配 PySR 符号回归(需 Julia,公式必须回测);图表增强;SkillHub 发布

版权与署名

本技能为原创工具,免费使用与二次分享;转载请注明出处。

  • 作者:七仔的AI工具箱
  • 方法论溯源:判断规则与坑话术蒸馏自达莱尔·哈夫《统计陷阱》(How to Lie with Statistics)、David S. Moore 等《统计学的世界》、查尔斯·惠伦《赤裸裸的统计学》,均为原创提炼 + 逐条出处标注,未包含任何受版权保护的原文逐字摘录。
  • 使用许可:CC BY 4.0(署名-相同方式共享)。