Back to skills
extension
Category: Data & AnalyticsNo API key required

数据分析小侦探

当用户提供任意数据集(结构化表格 CSV/JSON 或一段非结构化文章/舆情)并想要一份数据驱动决策报告时使用。它会自动判断 14 种分析模式里哪些适用,对每个模式按「数据事实 → 信息解读 → 可行动洞察 → 行动建议」四层输出,全程用业务大白话、不堆技术词,并渲染成 OPC 深色风格、每种模式配专属图表的交互式 HTML 报告。

personAuthor: user_1551a711hubcommunity

数据驱动决策报告(Data-Driven Decision)

一句话:你把手里的数据甩过来,它自己走完「发生了啥 → 意味着啥 → 该盯啥 → 明天干啥」四步,最后吐给你一份能直接拿去开会的人话报告,图都画好。

把任意数据集(结构化表格 非结构化文章)变成一份「业务能直接用的决策报告」——不是图表堆砌,而是一路走到行动建议。它和「只会画图」的工具的根本区别,在于强制走完业务的 4 层本质

  1. 数据事实:先把「到底发生了什么」钉死——不加工、不美化。例:销售额 5 月冲到 5.1 万,之后连跌 3 个月。
  2. 信息解读:把数字翻译成人话——「增长到顶了,现在在走下坡」。
  3. 可行动洞察:告诉你该盯什么——「真正在掉的是老客复购,不是新客不够」。
  4. 行动建议:直接给动作——「先把 7 月那批流失老客拉回来,比砸钱拉新划算」。

而每一层,都由自动挑出来的分析视角撑着。它扫一眼数据,从 14 个角度里挑真正用得上的来拆解,不凑数、不硬编:

  • 看清现状:趋势(整体往哪走)· 时序(节奏快慢)· 异常(谁不对劲)· 语义(大家原话在吐槽啥)
  • 看懂人 / 物:聚类(谁和谁一伙)· 分类(谁会跑 / 会坏)· 留存(能维持多久)· 关系(谁在带节奏)
  • 算清因果与钱:回归(每多投 1 块涨多少)· 因果(动作到底管不管用)· 增益(对谁推才不浪费)· 优化(钱花在刀刃上)
  • 推下一步:推荐(还想要啥)· 关联(啥常一起出现)

全程用大白话、不堆技术词,最终汇成 OPC 深色风格、每种模式配专属图表的交互式 HTML。

何时使用

  • 用户说「分析这份数据 / 这份表」「帮我出个分析报告」「从这篇文章里提炼结构化结论」「做个决策报告」。
  • 输入可以是:CSV / TSV / JSON(单文件或多个文件),也可以是一段文章/舆情/访谈文本
  • 用户强调「按某分析模式」或「不同模式用不同图表」时,直接启用本 skill。

工作流程

  1. 确认输入

    • 结构化数据:拿到文件路径(多个用逗号分隔,skill 会按共享 ID 列自动合并,例如 用户表 + 订单表 + 商品表)。
    • 非结构化文本:用户贴出的文章/评论,或 .txt/.md 文件路径。
  2. 运行分析引擎

    # 多表合并分析(推荐:把能对应的表一起传入)
    python3 scripts/analyze.py --input 用户.csv,订单.csv,商品.csv --name "电商全景" --out report.html
    
    # 单表
    python3 scripts/analyze.py --input 订单.csv --name "订单分析" --out report.html
    
    # 非结构化文章
    python3 scripts/analyze.py --text "把文章全文贴这里……" --name "舆情简报" --out report.html
    
    • --input:文件路径,多个用 , 分隔(会自动按 用户编号/商品编号/订单编号 等 ID 列 left join 合并)。
    • --text:直接传文章文本(与 --input 二选一)。
    • --name:报告标题。
    • --out:输出 HTML 路径(自包含,仅 ECharts 走 CDN)。

    用 skill 自带的示例数据直接复现(推荐先跑这个验证):

    cd <skill目录>
    python3 scripts/analyze.py \
      --input assets/sample_data/用户.csv,assets/sample_data/订单.csv,assets/sample_data/商品.csv \
      --name "电商全景决策报告" --out report.html
    # 非结构化文本路径:
    python3 scripts/analyze.py --text "$(cat assets/sample_data/示例文章.txt)" --name "舆情简报" --out report_text.html
    
  3. 交付报告

    • present_files 把生成的 HTML 呈现给用户(HTML 会在内置预览面板打开)。
    • 报告包含:Hero 概览(记录数/字段数/适用模式数/时间跨度)→ 逐模式卡片(图表 + 四层解读)→ 综合决策摘要 → 方法论与局限。

引擎能力(scripts/analyze.py

纯标准库实现,无需 pandas/numpy/sklearn,任意环境可直接跑。

  • 类型自动推断:数值 / 是/否标签 / 类别 / 日期 / 文本;多文件按共享 ID 自动合并。
  • 14 种模式(见 references/modes.md 的判定逻辑与图表映射): 分类(预测谁会流失)、回归(预估金额/次数)、聚类(给用户自然分群)、关联(找常一起买的搭配)、 异常(揪出反常记录)、时序(看变化节奏)、趋势(看整体走向与拐点)、推荐(猜你喜欢)、 留存(用户能留多久)、因果(动作到底有没有用)、增益(对谁推才有效)、关系(谁在影响谁)、 语义(读懂用户原话)、优化(把钱花在刀刃上)。
  • 非结构化抽取:从文章里识别时间、情绪、高频词、事件时间线,再喂给语义/时序模式。
  • 每模式四层输出:专属图表 + 数据事实 + 信息解读 + 至少 3 条可行动洞察 + 至少 2 条行动建议,标签化呈现。整套报告用业务语言,不出现算法/统计术语。
  • 图表选型:占比→环图;关系/趋势→折线/散点/桑基/关系网;多维→雷达/堆叠;排序→条形;购物篮→桑基图。

资源

  • scripts/analyze.py — 分析引擎(入口,含 CLI)。
  • assets/report_template.html — OPC 深色设计系统模板(青绿主色、玻璃卡片、星空/揭示动画),含注入点。
  • references/modes.md — 14 种模式的定义、所需数据、电商案例、业务动作、推荐图表。
  • references/业务语言范例.md — 业务大白话的标杆案例(电商销售额 vs 设备平均温度 同一套代码的真实输出), 含「写好业务语言的 5 条红线」与维护者检查清单。写/改任何叙述前先对照这份文档。
  • assets/sample_data/ — 可复现的示例数据集(用户.csv / 订单.csv / 商品.csv,均由 生成数据集.py(seed=42)生成)+ 示例文章.txt,用于一键复现报告。

复现性与数据真实性(发布前必须守住的两条底线)

  • 报告可复现:引擎固定 random.seed(42),K-Means 初始化、关联规则排序、网络节点排序均已做确定性处理。 用 assets/sample_data/ 里的三张表跑出来的 HTML 逐字节一致(多次运行 MD5 相同)。
  • 数据不造假:所有洞察与建议都从数据里算出来,绝不编造结论。如果某张数据本身支撑不了行动建议, 正确做法是回去改数据(重新生成/补充字段),而不是在文案里硬编建议。示例数据集已校验: 实验组流失率 0.167 < 对照组 0.217(活动有效)、5 个 GMV 离群账户(风控)、服饰↔运动等品类强连带等结论均来自真实数据。

表粒度(为什么要把三张表分开传)

引擎会按文件名/字段识别每张表的“粒度”,分别交给对应模式,避免把订单行误当成人:

  • 用户表(用户.csv,每人一行,含 0 订单用户)→ 分类、回归、聚类、异常、留存、因果、增益、关系
  • 订单表(订单.csv,每单一行)→ 关联、时序、推荐、语义
  • 商品表(商品.csv)→ 优化

注意事项

  • 样本量较小时结论仅供参考;活动效果类结论建议配合正式的分组对照实验一起看。
  • 文章类分析做的是轻量级的词语与情绪提取,长篇或专业场景建议再接更强大的文本分析服务。
  • 报告依赖 ECharts CDN,离线环境需把 echarts.min.js 本地化(替换模板中的 script src)。
  • 输出为单文件 HTML,可直接发给业务方或嵌入门户。