返回 Skill 列表
extension
分类: 数据与分析无需 API Key

实验数据预处理

# 实验数据预处理 ## 你遇到的痛点 - 实验做完了,数据一堆脏值:手抖记错的温度、仪器飘了的浓度,混在里头不剔掉,后面均值全被带偏,图也画歪。 - 算个均值中位数标准差还要开 Excel 点半天,十几列数据逐列点谁顶得住,点完还怕点错。 - 想画个分布图,结果 `import matplotlib` 直接红字报错——环境没装第三方库,卡在出图这一步。 ## 这个技能能做什么 实验数据预处理是一个**带真实代码的命令行程序**(非空壳)。你只要丢给它一个实验 CSV,它就一次性帮你做四件事并产出标准化结果: 1. **异常值剔除**:支持 IQR 法(默认,`Q1-1.5·IQR ~ Q3+1.5·IQR`)或 3σ 法(`均值±3·标准差`),自动识别数值列、剔除含异常值的整行。 2. **简单统计**:逐列给出样本量/均值/中位数/标准差/最小值/最大值/Q1/Q3/IQR/异常值数。 3. **绘图脚本生成**:输出一段 matplotlib 代码(plot_script.py 文本),你本地 `pip install matplotlib pandas` 后运行即可出直方图与箱线图。**本程序不直接依赖 matplotlib**,避免环境缺库而崩溃。 4. **标准化输出**:清洗后 `cleaned.csv` + 统计报告 `stats.md` + 绘图脚本 `plot_script.py`。 统计与 IQR/3σ 全部用**纯标准库**实现,开箱即跑;绘图是独立脚本,按需安装。 ## 四步出片(照做即得结果) **第一步:准备实验 CSV** ```bash # 第一行是表头,数值列程序自动识别;含文本的列(如编号)自动跳过 ``` **第二步:跑预处理(核心指令)** ```bash python exp_prep.py demo # 内置 mock 实验数据,立即看效果 python exp_prep.py process 数据.csv # 处理本地 CSV(默认 IQR 法) python exp_prep.py process 数据.csv --method=3sigma # 改用 3σ 法 ``` 程序输出: ``` # 实验数据预处理统计报告 > 异常值判定方法:iqr;数值列共 4 列。 ## 温度 | 均值 31.29 | 中位数 25.10 | 异常值数 1 | ## 浓度 | 均值 1.41 | 中位数 1.01 | 异常值数 1 | ## pH | 异常值数 0 | ## 产率 | 异常值数 0 | [已写入] .../cleaned.csv, stats.md, plot_script.py ``` **第三步:拿到三件套** 输出目录含:`cleaned.csv`(剔掉 2 个异常行后的干净数据)、`stats.md`(统计表)、`plot_script.py`(绘图脚本)。 **第四步:出图(可选)** ```bash pip install matplotlib pandas python plot_script.py # 生成各列直方图与箱线图 PNG ``` ## 能力体系 | 能力 | 说明 | 典型产出 | |---|---|---| | 异常值剔除 | IQR / 3σ,逐列判定、整行剔除 | cleaned.csv | | 简单统计 | 均值/中位数/标准差/最值/Q1/Q3/IQR | stats.md | | 绘图脚本 | 生成 matplotlib 代码(文本) | plot_script.py | | 零依赖统计 | 纯标准库,无需 pip | 可离线跑 | ## 输出报告字段 - **概览**:判定方法 / 数值列数 - **逐列统计**:n / 均值 / 中位数 / 标准差 / 最小 / 最大 / Q1 / Q3 / IQR / 剔除阈值 / 异常值数 / 异常值示例 - **配套文件**:cleaned.csv、plot_script.py ## 适合谁用 - 生化/材料/环境/生物等实验学科研究生:原始数据快速清洗 - 科研民工:每次实验完一键出统计与图,省下点 Excel 的时间 - 课程实验/毕设:把脏数据收拾干净再分析 - 任何做数据分析的人 ## ⚠️ 注意事项(必读) - **高度聚集列会过度剔除**:若某列大量取值相同(如 pH 几乎都 7.0),IQR 可能趋近 0 而把正常值判为异常。请结合领域知识核对,必要时换列或改方法。 - **整行删除**:默认剔除「任一数值列含异常值」的整行。若想"按列替换而非删行",请二次修改脚本。 - **3σ 假设正态**:强偏态数据优先用 IQR 法;3σ 法对非正态分布可能漏判或误判。 - **绘图需自备环境**:plot_script.py 依赖 matplotlib + pandas,本程序本体不依赖,未安装也能完成统计与清洗。 ## 触发词 实验数据、数据处理、数据预处理、异常值、离群点、IQR、3σ、三倍标准差、统计、均值、中位数、标准差、最小值、最大值、四分位、箱线图、直方图、绘图、数据清洗、数据分析、科研数据、生化、材料、环境、生物、CSV处理、免费、开源 ## 文件清单 - `SKILL.md` — 本文件 - `examples/exp_prep.md` — 主程序完整源码(复制为 `exp_prep.py` 即可运行,纯标准库无依赖) - `examples/usage.md` — 详细使用说明、方法对比、排错与自定义 - `examples/example_output.md` — 真实示例输出(mock 实验数据跑出的统计报告+清洗数据+绘图脚本)

person作者: user_51a923b7hubcommunity

实验数据预处理

导入实验 CSV,自动异常值剔除(IQR/3σ)、简单统计(均值/中位数/标准差/最小/最大/Q1/Q3)、生成 matplotlib 绘图脚本、输出清洗后 CSV 与统计报告。

本技能包含真实可运行的 Python 程序(统计用纯标准库,绘图脚本为独立文本、按需安装 matplotlib),源码见 examples/exp_prep.md。按上方"四步出片"操作即可在本地跑出结果。

核心能力

  1. 异常值剔除:IQR / 3σ,自动识别数值列、剔除含异常值整行。
  2. 简单统计:均值/中位数/标准差/最小/最大/Q1/Q3/IQR/异常值数。
  3. 绘图脚本生成:输出 matplotlib 代码(文本),可选安装运行出图。
  4. 标准化输出:cleaned.csv + stats.md + plot_script.py。

快速开始

python exp_prep.py demo                              # 内置 mock 实验数据,立即看效果
python exp_prep.py process 数据.csv                   # 处理本地 CSV(默认 IQR 法)
python exp_prep.py process 数据.csv --method=3sigma   # 改用 3σ 法

详细方法对比、自定义与排错,见 examples/usage.md;示例输出见 examples/example_output.md