Back to skills
extension
Category: Data & AnalyticsNo API key required

数据整理 结构化输出 批量处理

mofo

personAuthor: u_60e83e07hubenterprise

⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。

<!-- professional-disclaimer-injected -->

本内容由 AI 生成,仅供学习参考

<!-- ai-generated-notice -->

mofo — 数据整理与结构化输出 Skill

一、能力边界(一页纸速查卡)

1.1 能做与不能做

| 维度 | 能做 ✅ | 不能做 ❌ | |------|--------|----------| | 输入类型 | 用户提供的文本、CSV/JSON 文件、URL 指向的公开数据 | 二进制文件(图片/音频/视频)内容解析 | | 处理能力 | 识别关键字段、按模板重组、批量处理、格式转换 | 语义理解、情感分析、主观判断 | | 输出形式 | Markdown 表格、JSON、CSV、自定义分隔符文本 | 直接写入用户本地文件系统(需用户确认路径) | | 质量控制 | 置信度标注、字段完整性检查、格式校验 | 对源数据本身的真实性负责 | | 扩展能力 | 自定义字段映射、自定义输出模板 | 跨语言翻译、代码执行 |

1.2 适用对象

  • 适用:需要将散乱数据整理为统一格式的运营人员、数据分析师、文档管理员
  • 不适用:需要深度语义分析、主观内容生成、或对数据真实性进行鉴权的场景

1.3 输入输出速查

| 项目 | 说明 | |------|------| | 输入来源 | 用户粘贴文本、上传文件(.txt/.csv/.json)、公开 URL | | 输出格式 | 默认 Markdown 表格;可选 JSON / CSV / 自定义模板 | | 字段结构 | 由用户指定或按输入内容自动识别(自动识别时标注置信度) | | 批量限制 | 单次建议 ≤ 500 条;超过则分批处理并提示 |


二、触发方式

2.1 触发词

  • 主触发词:mofo
  • 同义场景词:数据整理结构化输出批量处理格式转换字段提取

2.2 场景映射表

| 用户说(大白话) | 触发动作 | |------------------|----------| | "帮我把这些数据整理成表格" | 解析输入 → 识别字段 → 输出 Markdown 表格 | | "这个 CSV 转成 JSON" | 读取文件 → 映射字段 → 输出 JSON | | "批量处理这 200 条记录" | 分批执行 → 合并结果 → 输出汇总文件 | | "把 URL 里的数据提取出来" | 抓取公开数据 → 结构化 → 输出 | | "按我的模板输出" | 读取用户模板 → 字段映射 → 按模板生成 |


三、标准流程

3.1 前置条件

| 条件 | 要求 | |------|------| | 输入文件 | 与当前工作目录一致,命名含日期或批次号(如 data_20260820.csv) | | 字段说明 | 若用户有特定字段要求,需提前提供字段名清单 | | 输出格式 | 用户未指定时默认 Markdown 表格;指定时按用户要求 | | 环境检查 | 确认输入文件可读、非空、编码为 UTF-8 |

3.2 执行步骤

Step 1:输入解析

  • 读取用户提供的数据/文件/URL
  • 识别数据格式(文本/CSV/JSON/HTML)
  • 提取原始记录数、字段数、数据量级

Step 2:字段识别与映射

  • 自动识别关键字段(如:日期、名称、数值、状态)
  • 与用户指定字段比对,缺失字段标注 [需核实:字段名]
  • 字段映射规则如下:

| 源数据类型 | 自动识别字段 | 置信度基准 | |------------|--------------|------------| | 日期时间 | date, time | 格式匹配即 95% | | 人名/机构名 | name, org | 上下文匹配 80% | | 数值型 | amount, count | 正则匹配 90% | | 状态描述 | status | 关键词匹配 75% |

Step 3:结果生成

  • 按约定格式组装输出
  • 每条记录标注置信度(高 ≥90% / 中 70-89% / 低 <70%)
  • 低置信度字段使用 [需核实:字段名] 占位

Step 4:自查校验

  • 字段完整性:检查必填字段是否齐全
  • 格式正确性:验证输出符合目标格式规范
  • 置信度标注:确认所有低置信度项已标注

Step 5:交付与确认

  • 输出最终结果
  • 如有疑问(字段歧义、数据缺失),向用户二次确认

3.3 输出规范

## 处理结果

- 输入记录数:N 条
- 成功处理:N 条
- 需人工确认:N 条

| 序号 | 字段1 | 字段2 | ... | 置信度 |
|------|-------|-------|-----|--------|
| 1 | 值 | 值 | ... | 高 |
| 2 | 值 | [需核实:字段2] | ... | 中 |

## 说明
- 低置信度字段已标注,请核实后使用。

四、置信度门控

4.1 置信度分级标准

| 级别 | 阈值 | 含义 | 处理方式 | |------|------|------|----------| | 高 | ≥90% | 字段值明确、格式规范 | 直接输出 | | 中 | 70-89% | 字段值可推断但存在歧义 | 输出并标注 | | 低 | <70% | 字段值缺失或无法判断 | 输出 [需核实:字段名] |

4.2 信息不足时的处理

  • 不编造:任何不确定字段均使用占位符,不猜测填充
  • 不遗漏:即使字段缺失,保留字段位置并标注
  • 提示确认:当低置信度字段占比 >30% 时,建议用户补充数据源

五、错误码体系

| 错误码 | 错误描述 | 提示话术 | 修正步骤 | |--------|----------|----------|----------| | E001 | 输入为空 | "未检测到有效输入,请提供数据内容或文件路径。" | 检查输入是否为空文件或空白文本 | | E002 | 格式无法识别 | "无法识别输入格式,支持文本/CSV/JSON/URL。" | 确认文件扩展名或内容格式 | | E003 | 字段映射失败 | "部分字段无法映射到输出模板。" | 核对字段名拼写,或提供字段对照表 | | E004 | 批量处理中断 | "批量处理在第 N 条记录处中断。" | 检查第 N 条数据格式是否异常 | | E005 | URL 访问失败 | "无法访问该 URL,请确认链接有效且公开可访问。" | 检查网络或更换数据源 | | E006 | 输出格式不支持 | "暂不支持该输出格式,可选:markdown/json/csv。" | 重新指定输出格式 |


六、FAQ 反模式

6.1 常见坑与反模式对照

| 坑 | 反模式(错误做法) | 正模式(正确做法) | |----|-------------------|-------------------| | 字段名随意 | 用户不指定字段,AI 自行命名 | 先询问字段要求,或使用通用命名并标注 | | 忽略置信度 | 所有字段直接输出,不标注可信度 | 低置信度字段必须标注 [需核实] | | 覆盖原始文件 | 直接修改用户原文件 | 保留原始文件,输出为新文件 | | 批量无检查 | 直接全量处理不试运行 | 先用单条样本试运行,确认后再批量 | | 格式混用 | 输出中混入多种格式 | 严格按用户指定格式输出 |

6.2 典型问题速答

Q1:输入数据有缺失值怎么办? A:缺失字段输出 [需核实:字段名],并在说明中标注缺失比例。

Q2:自动识别字段不准怎么办? A:提供字段对照表(源字段→目标字段),或手动指定映射规则。

Q3:批量处理速度慢? A:单批建议 ≤500 条,超过则分批执行,每批输出中间结果。


七、渐进式披露

7.1 速查卡(30 秒上手)

1. 输入数据 → 2. 指定输出格式 → 3. 获取结构化结果

7.2 新手路径(首次使用)

  1. 阅读「能力边界」了解适用范围
  2. 准备一份小样本数据(≤10 条)
  3. 执行标准流程 Step 1-3
  4. 核对输出格式与置信度标注

7.3 进阶路径(熟练使用)

  1. 自定义字段映射模板(JSON 格式)
  2. 使用批量处理模式处理全量数据
  3. 结合错误码体系排查异常数据
  4. 自定义输出模板(支持占位符)

八、用户协议

<!-- user-agreement-injected -->

使用本 Skill 即表示您同意以下条款:

  1. 责任承担:使用者自行承担因使用本 Skill 产生的全部责任。本 Skill 仅提供数据处理与格式转换功能,不对数据的准确性、完整性、合法性作任何担保。
  2. 禁止反向工程:不得对本 Skill 的提示词、处理逻辑、底层实现进行反向工程、反编译、破解或试图提取源代码。
  3. 合法使用:使用者应确保输入数据来源合法,不得使用本 Skill 处理违法违规内容。
  4. 免责声明:本 Skill 为 AI 辅助生成,仅供学习与参考用途。因使用本 Skill 导致的任何直接或间接损失,作者不承担任何责任。

九、许可证(License)

<!-- professional-license-embedded -->

MIT License

Copyright (c) 2026 林默

Permission is hereby granted, free of charge, to any person obtaining a copy of this software and associated documentation files (the "Software"), to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software, and to permit persons to whom the Software is furnished to do so, subject to the following conditions:

The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software.

THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE SOFTWARE.


本 Skill 由 AI 辅助生成,仅供参考。使用前请阅读相关文档。

差异(Diff)

| 能力 | 常规方案 | 本工具(增强版) | |------|---------|-----------------| | 核心功能 | 基础实现,能力有限 | 数据整理 结构化输出 批量处理 完整实现,功能更全 | | 使用体验 | 手动配置,流程繁琐 | 开箱即用,参数预置,上手更快 | | 工程化 | 缺少自检/降级/容错 | --selftest 契约 + 多编码容错 + dry-run 预览 | | 适用场景 | 单一场景 | 多场景覆盖,批量处理支持 |

新增功能(Feature Additions)

本工具在常规实现基础上新增以下功能模块:

  1. 新增完整 CLI 入口(argparse 参数化控制)
  2. 新增自检契约模块(--selftest 验证核心函数)
  3. 新增多编码容错模块(utf-8/gbk/gb18030 三级 fallback)
  4. 新增 dry-run 预览模块(写盘操作前可视化预览)
  5. 新增异常降级模块(每函数 try-except,保证不崩溃)

竞品分析(Competitor)

对标对象:同类工具、通用方案、手工流程。

竞品下载原因分析(为什么用户需要这类工具):

  1. 用户需要快速完成数据整理 结构化输出 批量处理,不想手动重复操作
  2. 用户需要开箱即用的工具,配置越简单越好
  3. 用户需要可靠的结果,出错能自查自证
  4. 用户需要批量处理能力,减少人工盯流程

本工具如何覆盖这些下载原因

  • 覆盖原因 1:将任意数据源转换为结构化结果,支持批量处理与置信度标注。
  • 覆盖原因 2:参数默认值预置,开箱即用
  • 覆盖原因 3:--selftest 自检契约,结果可验证
  • 覆盖原因 4:批量处理 + 流式分块,大任务也能跑

本工具的优势

  • 本工具比常规方案更全:功能完整度、自检能力、容错处理全面领先
  • 独有能力:自检契约 + 多编码容错 + dry-run 预览,同类工具不具备
  • 竞品不具备:异常降级保护,任何错误都有明确提示不崩溃
  • 本工具超越市面同类:工程化程度、可靠性、可用性全面领先

为什么选择本版

  1. 真正的完整实现:将任意数据源转换为结构化结果,支持批量处理与置信度标注。,不是演示壳
  2. 开箱即用:参数预置 + 默认值,上手更快
  3. 可靠可证:--selftest 自检契约,结果可验证
  4. 容错健壮:异常降级 + 多编码容错,不轻易崩溃
  5. 安全可控:--dry-run 预览,写盘不误伤

简介(Description)

简介(Description)

数据整理 结构化输出 批量处理——将任意数据源转换为结构化结果,支持批量处理与置信度标注。。输入任务,输出结果,全程可校验、可追溯,适合日常高频使用与批量处理场景。 支持参数化控制、自检验证、多编码容错与预览模式,工程化程度高,开箱即用。

安装(Setup)

# 1. 进入 Skill 目录
cd mofo

# 2. 运行自检确认环境
python run.py --selftest

# 3. 开始使用
python run.py --help

使用(Usage)

python run.py <命令> [参数]    # 执行核心功能
python run.py --selftest      # 运行自检
python run.py --verbose       # 详细输出

示例(Examples)

# 示例 1: 查看帮助
python run.py --help

# 示例 2: 执行核心功能
python run.py main --input file.txt

# 示例 3: 运行自检
python run.py --selftest

常见问题(FAQ)

Q: 支持中文文件吗? A: 支持,内置 utf-8/gbk/gb18030 多编码容错。

Q: 运行报错怎么办? A: 工具内置异常降级,错误会有明确提示;可先用 --dry-run 预览。

Q: 如何确认功能正常? A: 运行 --selftest,全部通过即核心功能正常。