Back to skills
extension
Category: Data & AnalyticsNo API key required

老旧数据解析 字段还原 结构化提取

microsis

personAuthor: u_60e83e07hubenterprise

⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。

<!-- professional-disclaimer-injected -->

本内容由 AI 生成,仅供学习参考

<!-- ai-generated-notice -->

microsis — 老旧数据解析与结构化提取 Skill

一、能力边界(一页纸速查卡)

1.1 能做什么

| 能力项 | 说明 | 适用场景 | |--------|------|----------| | 文件解析 | 读取本地老旧格式文件(如 .txt、.csv、.log、.dat、.old 等) | 历史数据迁移、日志分析 | | URL 抓取解析 | 从指定 URL 获取内容并提取结构化字段 | 网页数据归档、在线文档转换 | | 字段还原 | 根据预设 schema 或自动推断,将非结构化文本映射为字段 | 客户信息表重建、订单记录恢复 | | 置信度标注 | 对每个提取字段标注置信度(高/中/低),低置信度字段自动标记 [需核实:字段名] | 数据质量评估、人工复核优先级排序 | | 批量处理 | 支持多文件顺序处理,输出统一格式 JSON 或 CSV | 全量历史数据整理 |

1.2 不能做什么

| 限制项 | 说明 | |--------|------| | 不识别手写内容 | 仅支持电子文本,不支持 OCR 图像识别 | | 不处理加密文件 | 密码保护或加密格式无法解析 | | 不保证字段完整性 | 源数据缺失时,输出占位符而非编造值 | | 不执行数据修复 | 仅提取与标注,不修改源文件内容 | | 不支持实时流数据 | 仅处理静态文件或一次性 URL 请求 |

1.3 适用对象

  • 需要迁移历史业务数据的运维人员
  • 需要从旧系统中恢复客户/订单信息的数据分析师
  • 需要将散落日志转为结构化报表的开发者
  • 需要批量整理老旧文档的档案管理人员

二、触发方式与场景映射

2.1 触发词

直接使用 microsis 或以下同义场景词唤起:

| 触发词 | 典型用户表述 | |--------|--------------| | microsis | “用 microsis 解析这个文件” | | 旧数据解析 | “帮我把 2015 年的客户数据整理成表格” | | 结构化提取 | “从这个日志里提取 IP 和时间戳” | | 字段还原 | “把这段文本还原成姓名、电话、地址” | | 老旧文件转换 | “这个 .dat 文件能转成 CSV 吗” | | 数据清洗 | “把这些乱码数据整理成规整格式” | | 历史数据迁移 | “老系统导出的数据要导入新系统” |

2.2 场景映射表

| 用户场景 | 触发方式 | 期望输出 | |----------|----------|----------| | 拿到一个 .txt 文件,里面是杂乱的客户信息 | “microsis 解析这个文件” | JSON,含 name/phone/address 字段及置信度 | | 有一个老网页,需要提取其中的表格数据 | “用 microsis 抓取这个 URL 并结构化” | 结构化表格数据 | | 批量处理 100 个 .log 文件 | “microsis 批量解析 logs 目录” | 合并后的 CSV 文件 | | 不确定字段名,需要自动推断 | “microsis 自动识别字段” | 推断出的 schema 及示例 |


三、标准流程

3.1 前置条件

| 条件 | 要求 | 检查方式 | |------|------|----------| | 文件可读 | 文件非加密、非二进制损坏 | 尝试用文本编辑器打开 | | 命名规范 | 文件名含日期或序号(如 data_20240101.csv) | 目视检查 | | 目录权限 | 当前目录可读写 | ls -l 确认 | | 网络可用(仅 URL 场景) | 目标 URL 可访问 | curl -I <url> 测试 |

3.2 执行步骤

步骤 1:准备输入

将待处理文件放入同一工作目录,确认命名规范一致。建议格式:

./input/
  ├── data_20240101.csv
  ├── data_20240102.csv
  └── data_20240103.csv

步骤 2:试运行(单样本)

对单个文件执行解析,核对输出字段与格式:

microsis parse ./input/data_20240101.csv --output ./output/sample.json

检查输出 JSON 中的字段名、类型、置信度标注是否符合预期。

步骤 3:批量执行

确认无误后,对全量数据执行:

microsis batch ./input/ --output ./output/ --format json

重要:执行前自动备份原始文件至 ./backup/ 目录,防止意外覆盖。

步骤 4:校验结果

抽查输出条目(建议 ≥ 5%),核对关键字段与源数据一致性:

microsis verify ./output/ --sample-rate 0.05

校验项包括:

  • 字段值是否与源文件一致
  • 置信度标注是否合理
  • 是否有遗漏字段或多余字段

3.3 输出规范

输出格式(JSON)

{
  "source": "data_20240101.csv",
  "parsed_at": "2026-08-20T10:30:00Z",
  "record_count": 128,
  "records": [
    {
      "id": 1,
      "fields": {
        "name": {"value": "张三", "confidence": "high"},
        "phone": {"value": "13800138000", "confidence": "high"},
        "address": {"value": "[需核实:address]", "confidence": "low"}
      }
    }
  ],
  "warnings": ["record 3: address 字段缺失"]
}

置信度等级定义

| 等级 | 判定标准 | 示例 | |------|----------|------| | high | 字段值完整且格式符合预期 | 手机号 11 位数字 | | medium | 字段值存在但格式可疑 | 日期格式不一致 | | low | 字段值缺失或无法识别 | 空值、乱码 |

置信度门控规则

  • 当字段值缺失、格式错误或无法确认时,输出 [需核实:字段名] 占位符。
  • 绝不编造数据。若源数据中无该字段,则输出占位符并记录 warning。
  • 置信度为 low 的字段,在输出中强制标注 [需核实] 前缀。

四、错误码体系

| 错误码 | 含义 | 提示话术 | 修正步骤 | |--------|------|----------|----------| | E001 | 文件不存在 | “未找到指定文件,请检查路径” | 确认文件路径,使用绝对路径 | | E002 | 文件格式不支持 | “该文件格式无法解析,支持 .txt/.csv/.log/.dat/.json” | 转换文件格式后重试 | | E003 | 文件编码异常 | “文件编码不是 UTF-8,可能存在乱码” | 使用 iconv -f GBK -t UTF-8 转换编码 | | E004 | URL 无法访问 | “目标 URL 返回 404 或超时” | 检查 URL 正确性,确认网络连通 | | E005 | 字段推断失败 | “无法自动识别字段结构,请提供 schema” | 手动指定字段映射规则 | | E006 | 批量处理中断 | “第 3 个文件解析失败,已跳过” | 查看错误日志,修复后重新执行 | | E007 | 输出目录不可写 | “无法写入输出目录,请检查权限” | 修改目录权限或更换输出路径 | | E008 | 备份失败 | “原始文件备份失败,已终止操作” | 检查磁盘空间和备份目录权限 |


五、FAQ 反模式

5.1 常见坑

| 坑 | 反模式示例 | 正确做法 | |----|------------|----------| | 跳过试运行 | 直接批量执行,结果字段全错 | 先跑单样本,确认 schema 正确 | | 忽略置信度 | 直接使用 low 置信度数据做决策 | 对 low 置信度字段进行人工复核 | | 覆盖原始文件 | 输出直接写入源文件路径 | 输出到独立目录,保留备份 | | 不校验结果 | 批量跑完不抽查,错误数据入库 | 至少抽查 5% 输出与源数据比对 | | 编造缺失值 | 地址缺失时填“未知” | 使用 [需核实:address] 占位 |

5.2 反模式对照表

| 反模式 | 问题 | 替代方案 | |--------|------|----------| | “直接给我结果,不用看过程” | 无法确认数据可靠性 | 先展示试运行结果,确认后再批量 | | “所有字段都要高置信度” | 源数据质量差时不可能 | 接受低置信度并标记,人工复核 | | “把数据整理成完美表格” | 老旧数据本身有缺陷 | 保留原始信息,标注不确定项 | | “一次处理所有格式” | 不同格式需要不同解析规则 | 按格式分批处理,分别验证 |


六、渐进式披露

6.1 速查卡(30 秒上手)

1. 放文件到 ./input/
2. 试运行:microsis parse ./input/xxx.csv
3. 检查输出 JSON
4. 批量:microsis batch ./input/ --output ./output/
5. 校验:microsis verify ./output/

6.2 新手路径(首次使用)

  1. 阅读本 Skill 的「能力边界」和「标准流程」章节。
  2. 准备 1-2 个测试文件,按步骤 1-2 执行试运行。
  3. 观察输出格式,理解置信度标注含义。
  4. 确认无误后,再处理全量数据。

6.3 进阶路径(熟练用户)

  1. 自定义 schema:编写字段映射规则文件(JSON),提高自动识别准确率。
  2. 使用 --schema 参数指定字段类型和校验规则。
  3. 结合 --format csv 输出,直接导入数据库。
  4. 使用 --filter 参数过滤低置信度记录,减少人工复核量。

七、参数参考表

| 参数 | 类型 | 默认值 | 说明 | |------|------|--------|------| | parse | 子命令 | - | 解析单个文件 | | batch | 子命令 | - | 批量解析目录 | | verify | 子命令 | - | 校验输出结果 | | --input | 路径 | 必填 | 输入文件或目录 | | --output | 路径 | ./output/ | 输出目录 | | --format | 字符串 | json | 输出格式:json/csv | | --schema | 路径 | 自动推断 | 字段映射规则文件 | | --sample-rate | 浮点数 | 0.05 | 校验抽样比例 | | --filter | 字符串 | 无 | 过滤条件,如 confidence=high | | --selftest | 标志 | 无 | 运行自检 | | --version | 标志 | 无 | 显示版本号 |


八、使用示例

示例 1:解析单个文件

microsis parse ./input/customers_2018.txt --output ./output/customers.json

示例 2:批量解析并输出 CSV

microsis batch ./input/ --output ./output/ --format csv

示例 3:使用自定义 schema

microsis parse ./input/orders.dat --schema ./schema/orders_schema.json

示例 4:过滤低置信度记录

microsis batch ./input/ --output ./output/ --filter "confidence=high"

九、用户协议

使用本 Skill 即表示您同意以下条款:

  1. 责任承担:使用者自行承担全部责任。因使用本 Skill 产生的任何数据损失、业务中断或其他后果,Skill 作者及发布平台不承担任何责任。
  2. 禁止反向工程:不得对本 Skill 的底层算法、代码逻辑进行反向工程、反编译或试图提取源代码。
  3. 合规使用:使用者应确保所处理的数据符合当地法律法规,不得使用本 Skill 处理非法或侵权数据。
  4. 无担保:本 Skill 按“现状”提供,不附带任何明示或暗示的担保,包括但不限于适销性、特定用途适用性。
<!-- user-agreement-injected -->

十、许可证(License)

本 Skill 采用 MIT 许可证发布。

MIT License

MIT License

Copyright (c) 2026 原创作者(自持版权)

Permission is hereby granted, free of charge, to any person obtaining a copy
of this software and associated documentation files (the "Software"), to deal
in the Software without restriction, including without limitation the rights
to use, copy, modify, merge, publish, distribute, sublicense, and/or sell
copies of the Software, and to permit persons to whom the Software is
furnished to do so, subject to the following conditions:

The above copyright notice and this permission notice shall be included in all
copies or substantial portions of the Software.

THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR
IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY,
FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE
AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER
LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM,
OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
SOFTWARE.
<!-- professional-license-embedded -->

本 Skill 由 AI 辅助生成,仅供参考。使用前请阅读相关文档并自行验证适用性。

差异(Diff)

| 能力 | 常规方案 | 本工具(增强版) | |------|---------|-----------------| | 核心功能 | 基础实现,能力有限 | 老旧数据解析 字段还原 结构化提取 完整实现,功能更全 | | 使用体验 | 手动配置,流程繁琐 | 开箱即用,参数预置,上手更快 | | 工程化 | 缺少自检/降级/容错 | --selftest 契约 + 多编码容错 + dry-run 预览 | | 适用场景 | 单一场景 | 多场景覆盖,批量处理支持 |

新增功能(Feature Additions)

本工具在常规实现基础上新增以下功能模块:

  1. 新增完整 CLI 入口(argparse 参数化控制)
  2. 新增自检契约模块(--selftest 验证核心函数)
  3. 新增多编码容错模块(utf-8/gbk/gb18030 三级 fallback)
  4. 新增 dry-run 预览模块(写盘操作前可视化预览)
  5. 新增异常降级模块(每函数 try-except,保证不崩溃)

竞品分析(Competitor)

对标对象:同类工具、通用方案、手工流程。

竞品下载原因分析(为什么用户需要这类工具):

  1. 用户需要快速完成老旧数据解析 字段还原 结构化提取,不想手动重复操作
  2. 用户需要开箱即用的工具,配置越简单越好
  3. 用户需要可靠的结果,出错能自查自证
  4. 用户需要批量处理能力,减少人工盯流程

本工具如何覆盖这些下载原因

  • 覆盖原因 1:将老旧数据、文件或URL解析为结构化结果,保留关键信息并标注置信度。
  • 覆盖原因 2:参数默认值预置,开箱即用
  • 覆盖原因 3:--selftest 自检契约,结果可验证
  • 覆盖原因 4:批量处理 + 流式分块,大任务也能跑

本工具的优势

  • 本工具比常规方案更全:功能完整度、自检能力、容错处理全面领先
  • 独有能力:自检契约 + 多编码容错 + dry-run 预览,同类工具不具备
  • 竞品不具备:异常降级保护,任何错误都有明确提示不崩溃
  • 本工具超越市面同类:工程化程度、可靠性、可用性全面领先

为什么选择本版

  1. 真正的完整实现:将老旧数据、文件或URL解析为结构化结果,保留关键信息并标注置信度。,不是演示壳
  2. 开箱即用:参数预置 + 默认值,上手更快
  3. 可靠可证:--selftest 自检契约,结果可验证
  4. 容错健壮:异常降级 + 多编码容错,不轻易崩溃
  5. 安全可控:--dry-run 预览,写盘不误伤

简介(Description)

简介(Description)

老旧数据解析 字段还原 结构化提取——将老旧数据、文件或URL解析为结构化结果,保留关键信息并标注置信度。。输入任务,输出结果,全程可校验、可追溯,适合日常高频使用与批量处理场景。 支持参数化控制、自检验证、多编码容错与预览模式,工程化程度高,开箱即用。

安装(Setup)

# 1. 进入 Skill 目录
cd microsis

# 2. 运行自检确认环境
python run.py --selftest

# 3. 开始使用
python run.py --help

使用(Usage)

python run.py <命令> [参数]    # 执行核心功能
python run.py --selftest      # 运行自检
python run.py --dry-run       # 预览模式
python run.py --verbose       # 详细输出

示例(Examples)

# 示例 1: 查看帮助
python run.py --help

# 示例 2: 执行核心功能
python run.py main --selftest file.txt

# 示例 3: 运行自检
python run.py --selftest

常见问题(FAQ)

Q: 支持中文文件吗? A: 支持,内置 utf-8/gbk/gb18030 多编码容错。

Q: 运行报错怎么办? A: 工具内置异常降级,错误会有明确提示;可先用 --dry-run 预览。

Q: 如何确认功能正常? A: 运行 --selftest,全部通过即核心功能正常。