Back to skills
extension
Category: Data & AnalyticsNo API key required

阿拉丁智能图表数据可视化工坊

CSV/Excel/JSON → 9类矢量图表+数据体检+智能选型+A-D评分:数据可视化从半天缩到1分钟,零依赖离线可跑,数据不出本机。

personAuthor: user_d18c97eahubcommunity

阿拉丁智能图表数据可视化工坊(aladin-chart-forge)

任意结构化数据(CSV / TSV / JSON / Excel)一键变成 9 类可交互矢量图表,自动完成数据体检(缺失 / 异常值 IQR)、智能图表选型(按数据形态推荐最优图)、A-D 数据质量评分,并产出自包含 HTML 看板 + 可独立插入 PPT 的 SVG 矢量文件 + Excel 直开 CSV 三件套。数据可视化从人工半天缩到 1 分钟。阿拉丁出品。

何时触发

  • "数据可视化" / "画个图表" / "把数据做成图" / "CSV 转图表"
  • "销售报表" / "趋势图" / "占比分析" / "各渠道对比"
  • "相关性分析" / "身高体重散点" / "做张散点图看关系"
  • "多指标对比" / "雷达图" / "堆叠图" / "饼图占比"
  • 英文关键词:data visualization / chart generator / CSV to chart / bar chart / pie chart / scatter plot / dashboard
  • 用户给出表格数据并希望快速出图、做汇报材料

何时不触发

  • 用户要画流程图 / 架构图 / 思维导图等结构化示意图——本技能只做数值数据图表,用架构图工坊
  • 用户要实时联网抓取外部数据(股票行情 / 爬虫)——本技能只消费本地文件,不联网
  • 用户只问统计学术理论(p 值 / 假设检验原理)——直接回答即可,无需跑脚本
  • 用户要出版级科研配图(误差线 / 显著性标注)——本技能不做学术标注,建议专业绘图库
  • 用户给的是纯文本无数字的内容——无数值列无法量化绘图(会提示做频次统计)

能力边界

能做:

  1. 接入 CSV / TSV / JSON / Excel(xlsx) 四源,自动探测 UTF-8 / GBK / GB18030 编码,中文数字千分位 / 百分号 / 万 / 亿 容错
  2. 渲染 9 类矢量图:柱状、水平柱、折线、面积、饼、环、堆叠柱、雷达、散点(纯 SVG,无 CDN / 无 matplotlib / 无 echarts)
  3. 逐列数据体检:缺失率、极值、均值、标准差、IQR 异常值、类别去重与高频值
  4. 按数据形态智能推荐图表族(散点 / 频次 / 序列 / 分类单指标 / 分类多指标),可 --chart 手动指定
  5. 输出四件套:自包含 HTML 看板(评分环 + 全图 + 数据表 + 体检 + 选型)、独立 SVG 矢量文件、数据矩阵 CSV、体检 CSV
  6. 给出 0-100 分 A-D 数据质量评分与 P0/P1/P2 问题清单,汇报前先看清数据干不干净

不能做:

  1. 不联网抓取外部数据,只消费本地文件(数据不出本机)
  2. 不生成流程图 / 架构图 / 思维导图等结构化示意图
  3. 不做出版级学术配图(误差线 / 显著性星标)
  4. 不依赖 matplotlib / plotly / echarts / 任何第三方库或云 API(纯标准库)
  5. 不做预测建模(回归 / 拟合 / 机器学习),只做描述性可视化

使用流程(三步)

约定:{PY} 为 Python 3.8+ 解释器路径,{SKILL} 为本技能根目录。

第 1 步:数据接入(ingest)

{PY} {SKILL}/scripts/chart_ingest.py --csv 数据.csv --out _chart_ir.json
# 或 --tsv / --json / --xlsx;演示数据:--demo 目标目录
  • 表头支持中英文别名,自动探测编码;Excel 另存 CSV 中文不乱码
  • 没有真实数据想先看效果:{PY} {SKILL}/scripts/chart_ingest.py --demo demo 生成含缺失与异常值的演示集

第 2 步:分析与制图(build)

{PY} {SKILL}/scripts/chart_build.py --ir _chart_ir.json --out _chart_build.json [--chart line] [--max-charts 8]
  • 退出码:0 = 成功(含 REVIEW 门禁);2 = 缺 IR / 无数值列
  • 自动体检 + 选型 + 渲染全部适配图表,输出含 SVG 的 build JSON

第 3 步:生成报告(report)

{PY} {SKILL}/scripts/chart_report.py --build _chart_build.json --outdir out --title "XX数据可视化报告"

产出四件套:

  • chart_dashboard.html —— 自包含看板(评分环 + 全部图表 + 数据表 + 体检 + 选型建议),双击即看,直接发群
  • chart_N_<type>.svg —— 每张图独立矢量文件,直接拖进 PPT / Word / 网页
  • chart_data.csv —— 数据矩阵,UTF-8-SIG,Excel 直开无乱码
  • chart_profile.csv —— 列级体检表

契约与集成

  • IR 契约 aladin.chart/v1_chart_ir.json 标准化中间层,下游仪表盘 / 报告技能可复用
  • 全流程纯 Python 标准库,零第三方依赖,离线可跑,数据不出本机
  • 同输入同输出(确定性排序 + sort_keys),结果可复现、可审计

输入输出规范

输入:

  • 数据文件:CSV / TSV / JSON / Excel(xlsx)(必需,至少一列数值)
  • 可选:--chart 强制图表类型、--max-charts 图表上限、--title 报告标题

输出:

  • _chart_ir.json —— 标准化中间层
  • _chart_build.json —— 体检 + 选型 + 含 SVG 的分析产物
  • out/ 目录 —— HTML 看板 + SVG 矢量图 + 两份 CSV

输出位置: 当前工作目录(默认与源数据同级)

复用资源

| 文件 | 用途 | 加载时机 | |------|------|----------| | references/data-contracts.md | IR 契约 aladin.chart/v1 字段定义与产物清单 | 需要对接下游 / 理解产物结构时 | | references/chart-rules.md | 图表选型规则 + 数据质量评分规则(IQR / A-D) | 调整选型逻辑 / 解释评分时 | | references/usage-examples.md | 3 个完整场景(趋势 / 占比 / 散点)+ 最佳实践 + FAQ | 用户要看示例或排错时 |

合规与可信(TRACE 映射)

  • Trust(信任):纯本地运行,数据不上传、不联网,敏感业务数据零外泄风险
  • Reliability(可靠):确定性渲染(固定调色板 / 稳定排序 / 无随机),双跑结果一致;异常值体检可追溯
  • Adaptability(适配):平台中立(WorkBuddy / QClaw / ima 均可运行),四源接入,无需账号
  • Convention(规范):description 单行前置功能 + 触发词;IR 契约版本化;输出零时间戳可复算
  • Efficiency(高效):零依赖离线、单命令出四件套,从数据到汇报材料分钟级

常见问题

  • 表头识别失败:确认列名在别名表内(中文数字千分位自动清洗),或改列名后重试
  • GBK 乱码:无需转码,脚本自动探测 UTF-8/GBK/GB18030
  • 只想看某一种图chart_build.py --chart line 强制只生成折线图
  • 异常值很多:多为真实极值(如大促日),看业务确认;不影响图表渲染
  • 类别顺序乱了:类别按首次出现顺序保留(如 1月→2月→3月 不打乱)

出品

阿拉丁(aladin)· 数据可视化技能系列。同系列覆盖表格清洗(Excel 数据工坊)、文档解析等场景,契约互通、可组流水线。