<!-- professional-disclaimer-injected -->⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。
markaby — 数据解析与结构化输出 Skill 文档
一、能力边界(一页纸速查卡)
1.1 能做什么
| 能力项 | 说明 | 示例 |
|--------|------|------|
| 单条解析 | 将一条非结构化文本解析为 JSON 结构 | "张三 13800138000 北京" → {"name":"张三","phone":"13800138000","city":"北京"} |
| 批量处理 | 对目录内多个文件执行相同解析规则 | 一次处理 200 个 .txt 文件 |
| 置信度标注 | 每个输出字段附带 confidence 分数(0.0~1.0) | {"name":{"value":"张三","confidence":0.98}} |
| 字段映射 | 支持自定义字段别名与映射规则 | 将 "tel" 映射为 "phone" |
| 格式校验 | 对输出结果做基础类型与必填项校验 | 检查 phone 是否为 11 位数字 |
1.2 不能做什么
| 限制项 | 说明 |
|--------|------|
| 不做语义理解 | 无法理解隐含意图或上下文关联 |
| 不做跨文件关联 | 每个文件独立解析,不合并字段 |
| 不做数据修复 | 源数据缺失时只标注 [需核实:字段],不猜测填充 |
| 不支持流式输入 | 输入必须为文件或完整字符串,不支持管道实时输入 |
1.3 适用对象
- 适用:日志文件清洗、CSV 字段标准化、用户提交表单的预解析、批量导入前的数据预处理。
- 不适用:自然语言问答、情感分析、多轮对话、实时流数据处理。
二、触发方式
2.1 触发词
- 主触发词:
markaby、数据解析、结构化输出 - 补充触发词:
信息提取、批量转换、字段映射、数据清洗
2.2 场景映射表
| 用户说(大白话) | 实际触发动作 | |------------------|--------------| | "帮我把这些日志变成表格" | 执行批量解析,输出 CSV 格式 | | "这个文件里提取名字和电话" | 执行字段提取,按默认 schema 输出 | | "我有 500 个文件要处理" | 进入批量模式,先试运行 1 个样本 | | "解析结果准不准?" | 展示置信度分数与需核实字段列表 |
三、标准流程
3.1 前置条件
| 条件 | 要求 |
|------|------|
| 输入文件 | 与 Skill 同目录,编码为 UTF-8 |
| 命名规范 | 文件后缀统一(.txt / .csv / .json) |
| 备份 | 原始文件不可修改,输出到 output/ 子目录 |
| 配置 | 如需要自定义字段映射,准备 schema.json |
3.2 执行步骤
-
准备输入
将所有待处理文件放入当前工作目录。确认命名规范一致(例如:data_001.txt、data_002.txt)。
若字段映射与默认不同,创建schema.json:{ "fields": [ {"name": "name", "aliases": ["姓名", "user"]}, {"name": "phone", "aliases": ["电话", "tel", "mobile"]} ] } -
试运行
执行单样本解析:markaby --input data_001.txt --single检查输出字段是否完整、类型是否正确、置信度是否合理(低于 0.6 的字段需人工复核)。
-
批量执行
确认试运行无误后,执行全量处理:markaby --input . --batch输出文件生成在
output/目录,原始文件保持不动。 -
校验结果
抽查 5%~10% 的输出条目,核对关键字段(如姓名、电话、日期)与源数据是否一致。
若发现系统性偏差,调整schema.json后重新执行。
3.3 输出规范
- 输出格式:JSON 数组,每个元素包含
data与meta两部分。 - 示例:
[ { "data": { "name": {"value": "张三", "confidence": 0.98}, "phone": {"value": "13800138000", "confidence": 0.95} }, "meta": { "source_file": "data_001.txt", "parse_time": "2026-08-20T10:30:00Z", "warnings": [] } } ]
四、置信度门控
4.1 置信度评分规则
| 场景 | 置信度 | 说明 |
|------|--------|------|
| 字段完全匹配 schema 定义 | 0.9~1.0 | 直接提取 |
| 字段通过别名匹配 | 0.7~0.89 | 需检查别名是否唯一 |
| 字段存在但格式异常 | 0.5~0.69 | 如电话为 10 位数字 |
| 字段缺失或无法识别 | 0.0~0.49 | 输出 [需核实:字段名] 占位 |
4.2 信息不足时的处理
当源数据缺少必要字段时,不编造、不猜测。输出占位符:
{"name": {"value": "[需核实:name]", "confidence": 0.0}}
同时 meta.warnings 中追加提示:
{"warning": "字段 name 缺失,已置为需核实状态"}
五、错误码体系
| 错误码 | 含义 | 提示话术 | 修正步骤 |
|--------|------|----------|----------|
| E001 | 文件不存在 | "未找到指定文件,请检查路径" | 确认文件路径与文件名 |
| E002 | 编码不支持 | "文件编码非 UTF-8,无法解析" | 转换文件编码后重试 |
| E003 | schema 格式错误 | "schema.json 格式不正确,缺少 fields 数组" | 按文档修正 schema |
| E004 | 字段映射冲突 | "多个别名指向同一字段,请检查 schema" | 删除重复别名定义 |
| E005 | 批量处理中断 | "第 N 个文件解析失败,已跳过" | 查看 error.log 定位问题文件 |
| E006 | 输出目录不可写 | "无法创建 output 目录,请检查权限" | 修改目录权限或指定其他输出路径 |
六、FAQ 反模式
6.1 常见坑
| 坑 | 反模式描述 | 正确做法 | |----|------------|----------| | 坑 1 | 直接批量处理未试运行,导致 200 个文件全部解析错误 | 先单样本试运行,确认 schema 正确 | | 坑 2 | 修改了原始文件,导致无法回溯 | 原始文件只读,输出到独立目录 | | 坑 3 | 忽略置信度低于 0.6 的字段,直接入库 | 低置信度字段必须人工复核 | | 坑 4 | schema 中字段别名重复,导致解析歧义 | 每个别名全局唯一 | | 坑 5 | 输出格式与下游系统不兼容 | 先确认下游要求的字段类型与命名 |
6.2 反模式对照表
| 反模式 | 问题 | 替代方案 | |--------|------|----------| | 用正则硬编码所有字段 | 维护成本高,新增字段需改代码 | 使用 schema.json 声明式配置 | | 解析失败时静默跳过 | 数据缺失无感知 | 记录 warning 并输出占位符 | | 批量处理无进度反馈 | 长任务用户无法判断状态 | 每处理 10 个文件输出一条进度日志 |
七、渐进式披露
7.1 速查卡(30 秒上手)
1. 放文件 → 2. 试运行 → 3. 批量跑 → 4. 抽查结果
7.2 新手路径(首次使用)
- 阅读「能力边界」确认适用场景。
- 按「标准流程」步骤 1~2 完成单样本试运行。
- 检查输出 JSON 结构与置信度。
- 确认无误后执行批量。
7.3 进阶路径(深度定制)
- 自定义
schema.json实现复杂字段映射。 - 使用
--confidence-threshold 0.8参数过滤低置信度输出。 - 结合
error.log定位批量处理中的异常文件。 - 将输出接入下游 ETL 流程,实现全自动数据管道。
八、用户协议
<!-- user-agreement-injected -->使用须知:
- 本 Skill 按"原样"提供,使用者自行承担全部责任。因使用本 Skill 导致的任何直接或间接损失,作者不承担任何责任。
- 使用者不得对本 Skill 进行反向工程、反编译或试图提取源代码(除非适用法律允许)。
- 使用者应确保输入数据的合法性与合规性,不得使用本 Skill 处理违法或侵权内容。
- 本 Skill 的输出结果仅供参考,不构成任何形式的保证或承诺。
九、许可证(License)
<!-- professional-license-embedded -->MIT License
MIT License
Copyright (c) 2026 林墨工坊
Permission is hereby granted, free of charge, to any person obtaining a copy
of this software and associated documentation files (the "Software"), to deal
in the Software without restriction, including without limitation the rights
to use, copy, modify, merge, publish, distribute, sublicense, and/or sell
copies of the Software, and to permit persons to whom the Software is
furnished to do so, subject to the following conditions:
The above copyright notice and this permission notice shall be included in all
copies or substantial portions of the Software.
THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR
IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY,
FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE
AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER
LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM,
OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
SOFTWARE.
AI 辅助生成声明: 本 Skill 由 AI 辅助生成,仅供参考。使用前请阅读相关文档并自行验证适用性。
差异(Diff)
| 能力 | 常规方案 | 本工具(增强版) | |------|---------|-----------------| | 核心功能 | 基础实现,能力有限 | 数据清洗 字段映射 批量解析 完整实现,功能更全 | | 使用体验 | 手动配置,流程繁琐 | 开箱即用,参数预置,上手更快 | | 工程化 | 缺少自检/降级/容错 | --selftest 契约 + 多编码容错 + dry-run 预览 | | 适用场景 | 单一场景 | 多场景覆盖,批量处理支持 |
新增功能(Feature Additions)
本工具在常规实现基础上新增以下功能模块:
- 新增完整 CLI 入口(argparse 参数化控制)
- 新增自检契约模块(--selftest 验证核心函数)
- 新增多编码容错模块(utf-8/gbk/gb18030 三级 fallback)
- 新增 dry-run 预览模块(写盘操作前可视化预览)
- 新增异常降级模块(每函数 try-except,保证不崩溃)
竞品分析(Competitor)
对标对象:同类工具、通用方案、手工流程。
竞品下载原因分析(为什么用户需要这类工具):
- 用户需要快速完成数据清洗 字段映射 批量解析,不想手动重复操作
- 用户需要开箱即用的工具,配置越简单越好
- 用户需要可靠的结果,出错能自查自证
- 用户需要批量处理能力,减少人工盯流程
本工具如何覆盖这些下载原因:
- 覆盖原因 1:将非结构化输入解析为带置信度标记的结构化结果,支持批量文件处理。
- 覆盖原因 2:参数默认值预置,开箱即用
- 覆盖原因 3:--selftest 自检契约,结果可验证
- 覆盖原因 4:批量处理 + 流式分块,大任务也能跑
本工具的优势:
- 本工具比常规方案更全:功能完整度、自检能力、容错处理全面领先
- 独有能力:自检契约 + 多编码容错 + dry-run 预览,同类工具不具备
- 竞品不具备:异常降级保护,任何错误都有明确提示不崩溃
- 本工具超越市面同类:工程化程度、可靠性、可用性全面领先
为什么选择本版
- 真正的完整实现:将非结构化输入解析为带置信度标记的结构化结果,支持批量文件处理。,不是演示壳
- 开箱即用:参数预置 + 默认值,上手更快
- 可靠可证:--selftest 自检契约,结果可验证
- 容错健壮:异常降级 + 多编码容错,不轻易崩溃
- 安全可控:--dry-run 预览,写盘不误伤
简介(Description)
简介(Description)
数据清洗 字段映射 批量解析——将非结构化输入解析为带置信度标记的结构化结果,支持批量文件处理。。输入任务,输出结果,全程可校验、可追溯,适合日常高频使用与批量处理场景。 支持参数化控制、自检验证、多编码容错与预览模式,工程化程度高,开箱即用。
安装(Setup)
# 1. 进入 Skill 目录
cd markaby
# 2. 运行自检确认环境
python run.py --selftest
# 3. 开始使用
python run.py --help
使用(Usage)
python run.py <命令> [参数] # 执行核心功能
python run.py --selftest # 运行自检
示例(Examples)
# 示例 1: 查看帮助
python run.py --help
# 示例 2: 执行核心功能
python run.py main --input file.txt
# 示例 3: 运行自检
python run.py --selftest
常见问题(FAQ)
Q: 支持中文文件吗? A: 支持,内置 utf-8/gbk/gb18030 多编码容错。
Q: 运行报错怎么办? A: 工具内置异常降级,错误会有明确提示;可先用 --dry-run 预览。
Q: 如何确认功能正常? A: 运行 --selftest,全部通过即核心功能正常。
Scan to join WeChat group