<!-- professional-disclaimer-injected -->⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。
<!-- ai-generated-notice -->本内容由 AI 生成,仅供学习参考
nima0011 数据解析与结构化转换 Skill 文档
一、能力边界(一页纸速查卡)
1.1 能做与不能做
| 维度 | 能做 ✅ | 不能做 ❌ | |------|---------|-----------| | 输入类型 | 用户提供的文本、CSV/JSON 文件、公开 URL | 二进制文件(图片/音视频)、加密内容、需登录的私有系统 | | 处理能力 | 字段提取、格式转换、批量处理、自定义模板输出 | 语义理解、情感分析、跨语言翻译、数据清洗(仅做格式层处理) | | 输出形式 | Markdown 表格、JSON、CSV、纯文本 | 可视化图表、动态报告、可执行代码 | | 质量保障 | 置信度标注、字段完整性自查、二次确认机制 | 绝对正确性保证、业务决策建议 |
1.2 适用对象
- 适合:需要将散乱数据整理为固定格式的运营人员、需要批量转换文件格式的开发者、需要从 URL 提取结构化信息的研究者。
- 不适合:需要深度语义理解的任务、需要实时数据抓取的场景、对数据准确性有绝对要求的合规审计。
1.3 输入/输出规格速查
| 项目 | 规格 |
|------|------|
| 输入来源 | 用户直接粘贴文本、本地文件(同目录)、公开 URL |
| 输出文件类型 | .md / .json / .csv(由用户指定,默认 .md) |
| 字段结构 | 由用户定义模板,默认包含:id、source、content、confidence |
| 最大处理量 | 单次 ≤ 500 条记录;超过则分批执行 |
二、触发方式
2.1 触发词
- 主触发词:
代码审查、数据解析、结构化输出 - 补充触发词:
批量处理、格式转换、nima0011
2.2 场景映射表
| 用户说(大白话) | 实际触发动作 | |------------------|--------------| | "帮我把这个 CSV 转成 JSON" | 解析 CSV → 输出 JSON | | "这个网页里的表格帮我整理一下" | 提取 URL 中表格 → 结构化输出 | | "我这有一堆日志文件,帮我统一格式" | 批量解析日志 → 按模板输出 | | "看看这段文本里有哪些关键信息" | 识别关键字段 → 标注置信度输出 |
三、标准处理流程
3.1 前置条件
- 待处理文件与 Skill 运行目录一致,文件名遵循
input_*前缀规范。 - 用户已明确输出格式(JSON/CSV/Markdown)与字段模板;若未指定,使用默认模板。
- 单批数据量 ≤ 500 条;超出时自动分片。
3.2 执行步骤
| 步骤 | 操作 | 说明 |
|------|------|------|
| 1 | 输入确认 | 核对输入来源(文本/文件/URL),确认字段模板与输出格式 |
| 2 | 试运行 | 取 1 条样本执行,输出样例供用户确认 |
| 3 | 用户确认 | 用户核对样例字段与格式,提出修改意见(最多 2 轮) |
| 4 | 批量执行 | 对全量数据执行解析,保留原始文件备份至 backup/ 目录 |
| 5 | 结果校验 | 随机抽查 ≥ 5% 条目,核对关键字段与源数据一致性 |
| 6 | 输出交付 | 按约定格式输出,附置信度标注与处理日志 |
3.3 输出规范
{
"meta": {
"total": 128,
"processed": 128,
"failed": 0,
"timestamp": "2026-08-20T14:30:00Z"
},
"data": [
{
"id": "001",
"source": "input_001.csv",
"content": { "字段A": "值A", "字段B": "值B" },
"confidence": 0.95
}
]
}
字段说明:
confidence:0.00–1.00,表示字段提取的确定程度。低于 0.80 时在输出中标注[需核实:字段名]。failed:解析失败条目数,失败原因记录在error_log字段。
四、置信度门控
4.1 置信度判定规则
| 置信度区间 | 判定标准 | 输出处理 |
|-----------|----------|----------|
| 0.90–1.00 | 字段完整、格式明确、无歧义 | 直接输出 |
| 0.80–0.89 | 字段完整但存在格式差异或轻微歧义 | 输出并附注说明 |
| 0.60–0.79 | 关键字段缺失或格式混乱 | 输出 [需核实:字段名] 占位 |
| < 0.60 | 无法可靠提取 | 标记为 failed,记录原因 |
4.2 禁止行为
- 禁止编造:信息不足时不得推测填充,必须使用
[需核实:字段名]占位。 - 禁止静默丢弃:解析失败的条目必须记录在
error_log中,不得直接删除。
五、错误码体系
| 错误码 | 含义 | 提示话术 | 修正步骤 | |--------|------|----------|----------| | E001 | 输入文件不存在 | "未找到指定文件,请确认文件已放入当前目录" | 检查文件名与路径,重新放置后重试 | | E002 | 格式不支持 | "当前格式不在支持范围内(支持:CSV/JSON/TXT/MD)" | 转换格式后重试 | | E003 | 字段模板冲突 | "用户指定模板与输入数据字段不匹配" | 核对模板字段名,调整后重试 | | E004 | 批量超限 | "单批处理量超过 500 条,已自动分片" | 无需操作,等待分片处理完成 | | E005 | URL 无法访问 | "目标 URL 返回 404 或超时" | 检查 URL 有效性,或改为手动粘贴内容 | | E006 | 置信度过低 | "超过 30% 条目置信度低于 0.60,建议检查源数据质量" | 检查源数据格式,修正后重新执行 |
六、FAQ 与反模式
6.1 常见坑
| 坑 | 反模式(错误做法) | 正模式(正确做法) |
|----|-------------------|-------------------|
| 字段命名不一致 | 直接按模板硬匹配,导致大量 [需核实] | 先做字段映射表,确认别名后再执行 |
| 批量处理不备份 | 直接覆盖原文件 | 先复制至 backup/ 目录再处理 |
| 忽略置信度标注 | 所有条目统一输出,不区分置信度 | 严格按 4.1 规则标注,低置信度条目单独列出 |
| 一次处理全部数据 | 不试运行直接全量执行 | 先取 1 条样本试运行,用户确认后再批量 |
| 输出格式不统一 | 混合使用多种格式输出 | 严格按用户指定格式输出,默认 Markdown |
6.2 反模式对照表
| 反模式 | 后果 | 替代方案 |
|--------|------|----------|
| 用户未指定字段模板时自行猜测 | 输出字段与用户预期不符,返工 | 使用默认模板并明确告知用户 |
| 对低置信度条目强行填充 | 输出数据不可靠,误导后续使用 | 使用 [需核实] 占位,由用户补充 |
| 忽略错误日志 | 失败条目静默丢失 | 每次执行后展示 error_log 摘要 |
七、渐进式披露阅读路径
7.1 新手速查(30 秒上手)
- 将文件放入当前目录,命名
input_*。 - 输入:
代码审查 将 input.csv 转为 JSON。 - 等待试运行结果,确认后输入
确认执行。 - 在
output/目录获取结果文件。
7.2 进阶操作(完整能力)
- 自定义模板:输入
使用模板:{"name":"姓名","age":"年龄"}指定字段映射。 - 批量处理:输入
批量处理 目录下所有 input_* 文件,自动遍历执行。 - 置信度过滤:输入
仅输出置信度高于 0.85 的条目,自动过滤低质量结果。 - 错误重试:输入
重试失败条目,仅对error_log中的条目重新执行。
7.3 参数速查表
| 参数 | 可选值 | 默认值 | 说明 |
|------|--------|--------|------|
| format | json / csv / md | md | 输出格式 |
| template | 自定义 JSON 映射 | 默认四字段 | 字段映射模板 |
| batch_size | 1–500 | 500 | 单批处理量 |
| confidence_threshold | 0.00–1.00 | 0.00 | 置信度过滤阈值 |
| backup | true / false | true | 是否备份原文件 |
八、用户协议
<!-- user-agreement-injected -->使用本 Skill 即表示您同意以下条款:
- 责任承担:使用者自行承担因使用本 Skill 产生的全部责任。本 Skill 输出结果仅供参考,不构成任何形式的专业建议或保证。
- 禁止反向工程:不得对本 Skill 的底层逻辑、提示词结构、生成机制进行反向工程、破解、提取或二次分发。
- 合规使用:使用者须确保输入数据来源合法,不得使用本 Skill 处理涉及隐私、机密或违反法律法规的内容。
- 免责声明:本 Skill 按"原样"提供,不附带任何明示或暗示的保证,包括但不限于适销性、特定用途适用性和非侵权性。
九、许可证(License)
<!-- professional-license-embedded -->MIT License
Copyright (c) 2026 流云工坊
Permission is hereby granted, free of charge, to any person obtaining a copy of this software and associated documentation files (the "Software"), to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software, and to permit persons to whom the Software is furnished to do so, subject to the following conditions:
The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software.
THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE SOFTWARE.
文档版本:1.0.0 | 最后更新:2026-08-20 | 生成方式:AI 辅助生成,仅供学习参考
差异(Diff)
| 能力 | 常规方案 | 本工具(增强版) | |------|---------|-----------------| | 核心功能 | 基础实现,能力有限 | 数据解析 结构化转换 批处理 完整实现,功能更全 | | 使用体验 | 手动配置,流程繁琐 | 开箱即用,参数预置,上手更快 | | 工程化 | 缺少自检/降级/容错 | --selftest 契约 + 多编码容错 + dry-run 预览 | | 适用场景 | 单一场景 | 多场景覆盖,批量处理支持 |
新增功能(Feature Additions)
本工具在常规实现基础上新增以下功能模块:
- 新增完整 CLI 入口(argparse 参数化控制)
- 新增自检契约模块(--selftest 验证核心函数)
- 新增多编码容错模块(utf-8/gbk/gb18030 三级 fallback)
- 新增 dry-run 预览模块(写盘操作前可视化预览)
- 新增异常降级模块(每函数 try-except,保证不崩溃)
竞品分析(Competitor)
对标对象:同类工具、通用方案、手工流程。
竞品下载原因分析(为什么用户需要这类工具):
- 用户需要快速完成数据解析 结构化转换 批处理,不想手动重复操作
- 用户需要开箱即用的工具,配置越简单越好
- 用户需要可靠的结果,出错能自查自证
- 用户需要批量处理能力,减少人工盯流程
本工具如何覆盖这些下载原因:
- 覆盖原因 1:将用户提供的文件或链接解析为结构化结果,支持批量处理与置信度标注。
- 覆盖原因 2:参数默认值预置,开箱即用
- 覆盖原因 3:--selftest 自检契约,结果可验证
- 覆盖原因 4:批量处理 + 流式分块,大任务也能跑
本工具的优势:
- 本工具比常规方案更全:功能完整度、自检能力、容错处理全面领先
- 独有能力:自检契约 + 多编码容错 + dry-run 预览,同类工具不具备
- 竞品不具备:异常降级保护,任何错误都有明确提示不崩溃
- 本工具超越市面同类:工程化程度、可靠性、可用性全面领先
为什么选择本版
- 真正的完整实现:将用户提供的文件或链接解析为结构化结果,支持批量处理与置信度标注。,不是演示壳
- 开箱即用:参数预置 + 默认值,上手更快
- 可靠可证:--selftest 自检契约,结果可验证
- 容错健壮:异常降级 + 多编码容错,不轻易崩溃
- 安全可控:--dry-run 预览,写盘不误伤
简介(Description)
简介(Description)
数据解析 结构化转换 批处理——将用户提供的文件或链接解析为结构化结果,支持批量处理与置信度标注。。输入任务,输出结果,全程可校验、可追溯,适合日常高频使用与批量处理场景。 支持参数化控制、自检验证、多编码容错与预览模式,工程化程度高,开箱即用。
安装(Setup)
# 1. 进入 Skill 目录
cd nima0011
# 2. 运行自检确认环境
python run.py --selftest
# 3. 开始使用
python run.py --help
使用(Usage)
python run.py <命令> [参数] # 执行核心功能
python run.py --selftest # 运行自检
python run.py --verbose # 详细输出
示例(Examples)
# 示例 1: 查看帮助
python run.py --help
# 示例 2: 执行核心功能
python run.py main --input file.txt
# 示例 3: 运行自检
python run.py --selftest
常见问题(FAQ)
Q: 支持中文文件吗? A: 支持,内置 utf-8/gbk/gb18030 多编码容错。
Q: 运行报错怎么办? A: 工具内置异常降级,错误会有明确提示;可先用 --dry-run 预览。
Q: 如何确认功能正常? A: 运行 --selftest,全部通过即核心功能正常。
Scan to join WeChat group