<!-- professional-disclaimer-injected -->⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。
本内容由 AI 生成,仅供学习参考 <!-- ai-generated-notice -->
mdv — 数据洞察与可视化批处理引擎
一、能力边界:一页纸速查卡
1.1 能做(核心能力清单)
| 编号 | 能力项 | 说明 | 适用场景示例 | |------|--------|------|--------------| | C1 | 多源输入解析 | 支持用户提供的数据文件(CSV/JSON/Excel)、URL 链接、直接粘贴的文本数据 | 从网页表格提取数据、解析本地日志文件 | | C2 | 关键信息识别与保留 | 自动识别输入中的字段名、数据类型、时间戳、数值范围等关键要素 | 从非结构化文本中提取结构化字段 | | C3 | 约定格式输出 | 按用户指定的格式(JSON/CSV/Markdown 表格)生成规范化输出 | 生成符合下游系统要求的接口数据 | | C4 | 置信度标注 | 对每个输出字段标注置信度等级(高/中/低),不确定项明确提示 | 数据清洗时标记可疑字段 | | C5 | 批量处理与自定义格式 | 支持多文件批量处理,允许用户自定义输出模板 | 月度报表批量生成、多来源数据合并 |
1.2 不能做(明确边界)
| 编号 | 限制项 | 说明 | |------|--------|------| | L1 | 不执行数据清洗 | 本工具不修改原始数据,仅做格式转换与结构化处理 | | L2 | 不进行统计分析 | 不提供均值、方差、回归等统计计算能力 | | L3 | 不生成图表 | 输出为结构化数据,不生成可视化图表文件 | | L4 | 不处理二进制文件 | 仅支持文本类数据文件(CSV/JSON/XML/纯文本) | | L5 | 不保证数据准确性 | 输出质量取决于输入质量,对原始数据错误不负责 |
1.3 适用对象
- 数据分析师:需要快速将多源数据统一格式
- 运维工程师:需要批量解析日志文件并结构化输出
- 业务运营人员:需要将业务报表转换为标准格式
- 学生/研究者:需要整理实验数据或调研数据
二、触发方式:场景映射表
2.1 触发词
- 主触发词:
数据可视化、mdv - 辅助触发词:
批量处理、结构化输出、数据转换、格式统一
2.2 大白话场景映射
| 用户说(口语化表达) | 实际需求 | 触发动作 | |----------------------|----------|----------| | "帮我把这个 Excel 转成 JSON" | 格式转换 | 执行 C1 → C3 | | "这个网页表格能抓下来吗?" | URL 数据提取 | 执行 C1 → C2 → C3 | | "我有一堆日志文件要整理" | 批量处理 | 执行 C5 | | "这个数据靠谱吗?" | 置信度评估 | 执行 C4 | | "能不能按我的模板输出?" | 自定义格式 | 执行 C5 |
三、标准流程:从输入到输出
3.1 前置条件
| 条件项 | 要求 | 检查方式 |
|--------|------|----------|
| 输入文件格式 | CSV/JSON/XML/纯文本(UTF-8 编码) | 文件头检查 |
| 文件命名 | 建议使用 数据名_日期.扩展名 格式 | 目视检查 |
| 文件位置 | 与执行环境同一目录,或提供完整路径 | 路径检查 |
| 网络权限 | 若输入为 URL,需确认可访问 | 连通性测试 |
3.2 执行步骤(分步编号)
Step 1:输入确认
- 确认输入来源类型:文件 / URL / 直接粘贴
- 确认输出格式要求:JSON / CSV / Markdown 表格
- 确认是否需要置信度标注(默认开启)
Step 2:数据解析
- 读取输入内容,识别编码格式
- 提取字段名、数据类型、行数/记录数
- 检测异常值(空值、格式不一致、超范围数值)
Step 3:结构化处理
- 按字段类型分类:字符串、数值、日期、布尔值
- 统一日期格式(YYYY-MM-DD)
- 数值保留两位小数
- 字符串去除首尾空格
Step 4:置信度标注
- 高置信度(≥95%):字段值完整、格式正确、无歧义
- 中置信度(70%-94%):存在轻微格式问题或缺失部分信息
- 低置信度(<70%):字段值缺失、格式严重不一致、存在多义性
Step 5:输出生成
- 按约定格式生成输出文件
- 输出文件命名:
原文件名_processed.扩展名 - 附带处理报告(记录处理时间、记录数、异常数)
3.3 输出规范
标准输出结构(JSON 示例):
{
"meta": {
"source": "input.csv",
"processed_at": "2026-08-20T14:30:00Z",
"total_records": 150,
"error_count": 3
},
"data": [
{
"id": 1,
"name": "示例记录",
"value": 42.5,
"date": "2026-08-20",
"_confidence": {
"name": "high",
"value": "high",
"date": "medium"
}
}
]
}
字段完整性自查表:
| 检查项 | 标准 | 通过标准 | |--------|------|----------| | 字段完整性 | 所有字段均有值 | 缺失率 < 5% | | 格式正确性 | 日期/数值/字符串格式统一 | 格式错误率 < 2% | | 置信度标注 | 每个字段均有置信度 | 覆盖率 100% | | 编码正确性 | UTF-8 无乱码 | 无乱码字符 |
四、置信度门控机制
4.1 置信度等级定义
| 等级 | 阈值 | 判定标准 | 输出标记 |
|------|------|----------|----------|
| 高 | ≥95% | 字段值完整、格式规范、无歧义 | high |
| 中 | 70%-94% | 存在轻微问题但可修复 | medium |
| 低 | <70% | 严重缺失或格式混乱 | low |
4.2 不确定项处理
当遇到以下情况时,输出 [需核实:字段名] 占位符,绝不编造数据:
- 字段值为空且无法推断
- 日期格式无法识别
- 数值超出合理范围(如负数的年龄)
- 同一字段出现多种格式
示例:
{
"age": "[需核实:age]",
"_confidence": {
"age": "low"
}
}
4.3 二次确认机制
当出现以下情况时,主动向用户确认:
- 输入数据中超过 20% 的字段需要核实
- 存在多个可能的解析方式(如日期格式 MM/DD/YYYY vs DD/MM/YYYY)
- 用户指定的输出格式与输入数据不匹配
五、错误码体系
5.1 错误码速查表
| 错误码 | 含义 | 用户提示话术 | 修正步骤 | |--------|------|--------------|----------| | E001 | 文件不存在 | "未找到指定文件,请检查路径是否正确" | 1. 确认文件路径 2. 检查文件名拼写 3. 确认文件权限 | | E002 | 文件格式不支持 | "该文件格式不在支持范围内(CSV/JSON/XML/纯文本)" | 1. 转换文件格式 2. 或使用支持的格式重新导出 | | E003 | 编码错误 | "文件编码无法识别,请确认为 UTF-8 编码" | 1. 使用文本编辑器转换编码 2. 重新保存为 UTF-8 | | E004 | URL 无法访问 | "目标 URL 无法访问,请检查网络或链接有效性" | 1. 确认网络连接 2. 检查 URL 拼写 3. 确认目标服务器状态 | | E005 | 数据解析失败 | "数据解析失败,请检查数据格式是否完整" | 1. 检查数据是否有缺失列 2. 确认分隔符是否正确 3. 检查引号是否配对 | | E006 | 输出格式冲突 | "指定的输出格式与数据不兼容" | 1. 调整输出格式 2. 或修改数据以匹配格式要求 | | E007 | 批量处理中断 | "批量处理在第 N 个文件处中断" | 1. 检查第 N 个文件的格式 2. 修复后重新执行 |
5.2 错误处理流程
检测到错误 → 记录错误码和上下文 → 生成错误报告 → 提示用户 → 等待用户指令
六、FAQ 反模式对照
6.1 常见坑与正确做法
| 坑(反模式) | 问题描述 | 正确做法 |
|--------------|----------|----------|
| 盲目信任输入 | 直接使用输入数据,不做任何校验 | 先执行数据质量检查,识别异常值 |
| 忽略编码问题 | 不检查文件编码,导致乱码 | 统一使用 UTF-8 编码,处理前先检测 |
| 过度处理 | 对数据做超出范围的修改(如四舍五入到整数) | 保持原始精度,仅做格式统一 |
| 不标注置信度 | 对所有数据一视同仁,不区分质量 | 对每个字段标注置信度,低置信度明确提示 |
| 编造缺失值 | 对空值随意填充猜测值 | 使用 [需核实:字段] 占位,交由用户确认 |
6.2 反模式对照表
| 场景 | 反模式做法 | 推荐做法 | |------|------------|----------| | 日期格式不统一 | 统一转换为一种格式,不提示 | 转换后标注置信度,提示用户确认 | | 数值超出范围 | 直接截断或取整 | 保留原始值,标注低置信度 | | 字段名不一致 | 自动重命名,不告知用户 | 保留原始字段名,在报告中列出映射关系 |
七、渐进式披露:分层次阅读路径
7.1 速查卡(30 秒上手)
输入 → 解析 → 结构化 → 置信度标注 → 输出
↑ ↑ ↑ ↑
确认格式 识别字段 统一格式 标记不确定项
快速操作三步:
- 准备输入文件(CSV/JSON/纯文本)
- 指定输出格式(JSON/CSV/Markdown)
- 执行并检查输出报告
7.2 新手路径(首次使用)
- 阅读「能力边界」了解工具范围
- 使用单个小文件试运行
- 检查输出格式和置信度标注
- 逐步增加数据量
7.3 进阶路径(熟练用户)
- 自定义输出模板(支持 Jinja2 模板语法)
- 批量处理时使用配置文件统一参数
- 集成到自动化流水线(支持命令行调用)
- 使用
--selftest验证环境配置
八、命令行接口
8.1 命令格式
mdv [选项] <输入文件或URL>
8.2 参数说明
| 参数 | 说明 | 默认值 |
|------|------|--------|
| --selftest | 运行自检程序,验证环境配置 | 无 |
| --version | 显示版本信息 | 无 |
| --format | 输出格式(json/csv/markdown) | json |
| --confidence | 是否标注置信度(on/off) | on |
| --output | 输出文件路径 | 自动生成 |
| --batch | 批量处理模式(需配合目录参数) | off |
8.3 使用示例
# 单文件处理
mdv data.csv --format json
# 批量处理
mdv ./data_dir/ --batch --format csv
# 运行自检
mdv --selftest
# 查看版本
mdv --version
九、批量处理指南
9.1 批量处理前置检查
| 检查项 | 要求 | 操作 |
|--------|------|------|
| 文件命名规范 | 统一前缀+日期格式 | 如 sales_20260820.csv |
| 文件格式统一 | 所有文件使用相同扩展名 | 混合格式需分批处理 |
| 字段结构一致 | 所有文件包含相同列 | 不一致时需预处理 |
9.2 批量处理流程
- 准备输入:将待处理文件放入同一目录,确认命名规范一致
- 试运行:先用单个样本执行,核对输出字段与格式
- 批量执行:确认无误后对全量数据执行,并保留原始文件备份
- 校验结果:抽查输出条目,核对关键字段与源数据一致
9.3 批量处理报告
每次批量处理生成 batch_report.json,包含:
- 处理文件总数
- 成功/失败文件列表
- 每个文件的记录数、异常数
- 处理耗时统计
十、用户协议
使用本 Skill 即表示您同意以下条款:
-
责任承担:使用者自行承担使用本 Skill 产生的全部责任。本 Skill 仅提供数据处理与格式转换功能,不对数据的准确性、完整性、合法性做出任何明示或暗示的保证。
-
使用限制:本 Skill 仅供学习与参考用途,不得用于任何违反法律法规的活动。使用者应确保其输入数据来源合法,且不侵犯第三方权益。
-
禁止反向工程:使用者不得对本 Skill 进行反向工程、反编译、反汇编,或试图提取源代码、算法、内部逻辑。
-
免责声明:因使用本 Skill 而产生的任何直接、间接、偶然、特殊或后果性损害,本 Skill 作者不承担任何责任。
-
协议变更:本协议可能随时更新,更新后的协议将在本 Skill 文档中发布。继续使用本 Skill 即表示接受更新后的协议。
十一、许可证(License)
本 Skill 采用 MIT 许可证发布。
MIT License
MIT License
Copyright (c) 2026 原创作者(自持版权)
Permission is hereby granted, free of charge, to any person obtaining a copy
of this software and associated documentation files (the "Software"), to deal
in the Software without restriction, including without limitation the rights
to use, copy, modify, merge, publish, distribute, sublicense, and/or sell
copies of the Software, and to permit persons to whom the Software is
furnished to do so, subject to the following conditions:
The above copyright notice and this permission notice shall be included in all
copies or substantial portions of the Software.
THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR
IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY,
FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE
AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER
LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM,
OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
SOFTWARE.
<!-- professional-license-embedded -->
附录:版本历史
| 版本 | 日期 | 变更内容 | |------|------|----------| | 1.0.0 | 2026-08-20 | 初始版本,包含核心功能与文档 |
本 Skill 由 AI 辅助生成,仅供参考。使用前请阅读相关文档。
差异(Diff)
| 能力 | 常规方案 | 本工具(增强版) | |------|---------|-----------------| | 核心功能 | 基础实现,能力有限 | 数据洞察 可视化 批处理引擎 完整实现,功能更全 | | 使用体验 | 手动配置,流程繁琐 | 开箱即用,参数预置,上手更快 | | 工程化 | 缺少自检/降级/容错 | --selftest 契约 + 多编码容错 + dry-run 预览 | | 适用场景 | 单一场景 | 多场景覆盖,批量处理支持 |
新增功能(Feature Additions)
本工具在常规实现基础上新增以下功能模块:
- 新增完整 CLI 入口(argparse 参数化控制)
- 新增自检契约模块(--selftest 验证核心函数)
- 新增多编码容错模块(utf-8/gbk/gb18030 三级 fallback)
- 新增 dry-run 预览模块(写盘操作前可视化预览)
- 新增异常降级模块(每函数 try-except,保证不崩溃)
竞品分析(Competitor)
对标对象:同类工具、通用方案、手工流程。
竞品下载原因分析(为什么用户需要这类工具):
- 用户需要快速完成数据洞察 可视化 批处理引擎,不想手动重复操作
- 用户需要开箱即用的工具,配置越简单越好
- 用户需要可靠的结果,出错能自查自证
- 用户需要批量处理能力,减少人工盯流程
本工具如何覆盖这些下载原因:
- 覆盖原因 1:将数据/文件/URL转为结构化结果,支持批量处理与置信度标注。
- 覆盖原因 2:参数默认值预置,开箱即用
- 覆盖原因 3:--selftest 自检契约,结果可验证
- 覆盖原因 4:批量处理 + 流式分块,大任务也能跑
本工具的优势:
- 本工具比常规方案更全:功能完整度、自检能力、容错处理全面领先
- 独有能力:自检契约 + 多编码容错 + dry-run 预览,同类工具不具备
- 竞品不具备:异常降级保护,任何错误都有明确提示不崩溃
- 本工具超越市面同类:工程化程度、可靠性、可用性全面领先
为什么选择本版
- 真正的完整实现:将数据/文件/URL转为结构化结果,支持批量处理与置信度标注。,不是演示壳
- 开箱即用:参数预置 + 默认值,上手更快
- 可靠可证:--selftest 自检契约,结果可验证
- 容错健壮:异常降级 + 多编码容错,不轻易崩溃
- 安全可控:--dry-run 预览,写盘不误伤
简介(Description)
简介(Description)
数据洞察 可视化 批处理引擎——将数据/文件/URL转为结构化结果,支持批量处理与置信度标注。。输入任务,输出结果,全程可校验、可追溯,适合日常高频使用与批量处理场景。 支持参数化控制、自检验证、多编码容错与预览模式,工程化程度高,开箱即用。
安装(Setup)
# 1. 进入 Skill 目录
cd mdv
# 2. 运行自检确认环境
python run.py --selftest
# 3. 开始使用
python run.py --help
使用(Usage)
python run.py <命令> [参数] # 执行核心功能
python run.py --selftest # 运行自检
python run.py --verbose # 详细输出
示例(Examples)
# 示例 1: 查看帮助
python run.py --help
# 示例 2: 执行核心功能
python run.py main --input file.txt
# 示例 3: 运行自检
python run.py --selftest
常见问题(FAQ)
Q: 支持中文文件吗? A: 支持,内置 utf-8/gbk/gb18030 多编码容错。
Q: 运行报错怎么办? A: 工具内置异常降级,错误会有明确提示;可先用 --dry-run 预览。
Q: 如何确认功能正常? A: 运行 --selftest,全部通过即核心功能正常。
微信扫一扫