返回 Skill 列表
extension
分类: 数据与分析无需 API Key

数据整理 结构化转换 批量处理

zippy

person作者: u_60e83e07hubenterprise

⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。

<!-- professional-disclaimer-injected -->

本内容由 AI 生成,仅供学习参考

<!-- ai-generated-notice -->

zippy 技能手册

一、能力边界速查卡

1.1 能做与不能做

| 维度 | 能做 | 不能做 | |------|------|--------| | 输入类型 | 用户提供的文本、表格文件(CSV/TSV)、JSON、URL 指向的公开数据 | 需要登录鉴权的私有接口、二进制加密文件 | | 处理能力 | 关键信息提取、字段映射、格式标准化、批量转换 | 语义理解之外的推理判断、主观内容生成 | | 输出形式 | 结构化 JSON、CSV、Markdown 表格,支持自定义字段顺序 | 直接写入用户本地文件系统(需用户确认后提供路径) | | 质量保障 | 对每条输出标注置信度(高/中/低) | 对缺失字段进行无依据的猜测填充 | | 批量能力 | 支持多文件批量处理,自动识别命名规律 | 处理超过 1000 条记录的超大批量任务(建议分批) |

1.2 适用对象

  • 需要将散乱数据整理为统一格式的运营人员
  • 需要从网页或文档中提取结构化信息的分析人员
  • 需要批量转换文件格式的开发人员
  • 需要快速验证数据质量的测试人员

二、触发方式与场景映射

2.1 触发词

当用户输入包含以下任一关键词时,本技能自动激活:

  • zippy(主触发词)
  • 数据转换 / 结构化输出 / 批量处理 / 格式整理(同义触发词)
  • 帮我整理这个文件 / 把这段内容转成表格(意图触发)

2.2 场景映射表

| 用户说(大白话) | 实际需求 | 本技能响应 | |------------------|----------|------------| | "这个 CSV 乱得很,帮我理理" | 清洗并标准化 CSV 字段 | 解析字段,按约定格式重组,输出标准化结果 | | "把这个网页里的产品信息抓出来" | 从 URL 提取结构化数据 | 抓取页面,识别产品字段,输出 JSON | | "我有 50 个文件要统一格式" | 批量格式转换 | 先单样本试运行,确认后批量执行 | | "这个 JSON 里有些字段我不需要" | 字段筛选与重排 | 按用户指定字段白名单过滤输出 |


三、标准处理流程

3.1 前置条件

| 条件项 | 要求 | 检查方式 | |--------|------|----------| | 输入文件 | 与工作目录同目录,命名含批次标识(如 input_01.csv) | 执行 ls 确认 | | 格式声明 | 用户需明确输入格式与期望输出格式 | 对话确认或默认按 JSON 输出 | | 字段映射 | 若需字段重命名,用户需提供映射关系 | 无映射时保留原字段名 | | 环境检查 | 确认 zippy 版本可用 | 执行 zippy --version |

3.2 执行步骤

第一步:输入解析

  1. 识别输入类型(文本/文件/URL)
  2. 读取原始内容,检测编码与分隔符
  3. 提取关键字段清单,与用户确认字段含义

第二步:规则应用

  1. 按以下优先级处理字段:
    • 用户显式指定的字段映射 > 通用命名规范 > 原样保留
  2. 对每个字段执行类型校验(字符串/数字/日期/布尔)
  3. 对异常值标记 [需核实:字段名] 占位符

第三步:置信度标注

| 置信度等级 | 判定条件 | 标注方式 | |------------|----------|----------| | 高 | 字段值完整且类型匹配 | 不加标注 | | 中 | 字段值存在但格式可疑(如日期格式不统一) | 追加 [中置信] | | 低 | 字段缺失或值明显异常 | 追加 [需核实:字段名] |

第四步:输出生成

  1. 按约定格式生成结果(默认 JSON)
  2. 自查清单:
    • [ ] 所有字段是否完整
    • [ ] 格式是否符合约定
    • [ ] 置信度标注是否到位
  3. 输出结果,并附处理摘要(输入条数、输出条数、异常数)

3.3 输出规范

{
  "meta": {
    "input_count": 10,
    "output_count": 10,
    "warning_count": 2,
    "processed_at": "2026-08-19T10:30:00Z"
  },
  "data": [
    {
      "id": "001",
      "name": "示例条目",
      "value": 42,
      "note": "[需核实:value]"
    }
  ]
}

四、置信度门控机制

4.1 基本原则

绝不编造数据。 当信息不足或存在歧义时,使用 [需核实:字段名] 占位,并在输出摘要中说明原因。

4.2 常见需核实场景

| 场景 | 处理方式 | 示例 | |------|----------|------| | 字段缺失 | 输出占位符,不猜测默认值 | "age": "[需核实:age]" | | 格式冲突 | 保留原始值,标注低置信度 | "date": "2024/1/5 [需核实:date]" | | 编码异常 | 尝试常见编码,失败则标记 | "content": "[需核实:content-encoding]" | | 语义歧义 | 输出所有可能值,标注需用户确认 | "type": "A/B [需核实:type]" |

4.3 用户确认流程

当出现 3 个以上需核实字段时,暂停输出,向用户提问:

检测到以下字段存在歧义,请确认处理方式:

  1. date 字段格式不统一,是否统一转为 ISO 8601?
  2. category 字段存在未知值,是否忽略或映射为"其他"?

五、错误码体系

| 错误码 | 含义 | 提示话术 | 修正步骤 | |--------|------|----------|----------| | E001 | 输入文件不存在 | "未找到指定文件,请确认路径是否正确" | 检查文件名与路径,重新输入 | | E002 | 格式无法解析 | "无法识别输入格式,请确认文件类型" | 提供文件头 10 行样本,确认格式 | | E003 | 字段映射冲突 | "字段映射存在冲突,请检查映射关系" | 列出冲突字段,请用户指定优先级 | | E004 | 批量处理中断 | "批量处理在第 N 条中断,请检查数据" | 查看错误日志,修复后从断点续跑 | | E005 | 输出格式不支持 | "暂不支持该输出格式,请选择 JSON/CSV/Markdown" | 重新指定输出格式 | | E006 | URL 访问失败 | "无法访问目标 URL,请检查网络或链接有效性" | 确认 URL 可公开访问后重试 |


六、FAQ 与反模式对照

6.1 常见坑

| 坑 | 反模式(错误做法) | 正模式(正确做法) | |----|-------------------|-------------------| | 忽略字段缺失 | 直接跳过缺失字段,不输出任何标记 | 输出 [需核实:字段名] 占位符 | | 过度推断 | 根据上下文猜测缺失值并填入 | 标注需核实,交由用户确认 | | 批量盲目执行 | 直接对全量数据执行,不做样本验证 | 先跑单条样本,核对无误后再全量 | | 覆盖原始文件 | 直接修改源文件,无备份 | 输出到新文件,保留原始文件 | | 忽略编码问题 | 假设所有文件都是 UTF-8 | 检测编码,异常时提示用户 |

6.2 反模式对照表

| 反模式 | 后果 | 替代方案 | |--------|------|----------| | "这个字段肯定是日期,我直接转了" | 格式错误导致下游解析失败 | 先确认格式,再转换 | | "缺失的我就填 0 吧" | 数据失真,影响分析结果 | 用占位符标记,让用户决定 | | "50 个文件一起跑吧" | 中途出错难以定位 | 先跑 1 个,再跑 5 个,最后全量 |


七、渐进式阅读路径

7.1 新手快速上手(30 秒)

  1. 将文件放入工作目录
  2. 输入:zippy 帮我整理 input.csv
  3. 查看输出的 JSON 结果
  4. 如有 [需核实] 标记,回复确认即可

7.2 进阶用户指南(3 分钟)

  1. 自定义字段映射:提供映射关系,如 {"原字段A": "新字段B"}
  2. 批量处理:文件命名含序号(data_01.csvdata_50.csv),执行 zippy --batch
  3. 格式定制:指定输出为 CSV 或 Markdown 表格
  4. 质量校验:使用 zippy --selftest 验证当前环境配置

7.3 高级技巧

  • 管道处理:将输出结果作为下一个处理步骤的输入
  • 规则文件:将常用字段映射保存为规则文件,重复使用
  • 异常捕获:使用 --strict 模式,遇到异常立即停止并报告

八、命令行接口参考

| 命令 | 参数 | 说明 | |------|------|------| | zippy | 无 | 进入交互模式 | | zippy --selftest | 无 | 运行自检,验证环境配置 | | zippy --version | 无 | 显示版本号 | | zippy --batch | 文件通配符 | 批量处理模式 | | zippy --strict | 无 | 严格模式,遇错即停 | | zippy --output | 格式名 | 指定输出格式(json/csv/md) |


用户协议

<!-- user-agreement-injected -->

使用本 Skill 即表示您同意以下条款:

  1. 责任承担:使用者自行承担因使用本 Skill 产生的全部责任。本 Skill 提供的处理结果仅供参考,不构成任何形式的保证或承诺。

  2. 禁止反向工程:不得对本 Skill 的底层逻辑、提示词结构、生成机制进行反向工程、破解、提取或二次传播。

  3. 合规使用:使用者应确保输入数据的合法性与合规性,不得使用本 Skill 处理违法违规内容。

  4. 免责声明:本 Skill 为 AI 辅助生成,可能存在缺陷或不足,使用者应自行验证输出结果的准确性与适用性。


差异(Diff)

| 能力 | 常规方案 | 本工具(增强版) | |------|---------|-----------------| | 核心功能 | 基础实现,能力有限 | 数据整理 结构化转换 批量处理 完整实现,功能更全 | | 使用体验 | 手动配置,流程繁琐 | 开箱即用,参数预置,上手更快 | | 工程化 | 缺少自检/降级/容错 | --selftest 契约 + 多编码容错 + dry-run 预览 | | 适用场景 | 单一场景 | 多场景覆盖,批量处理支持 |

新增功能(Feature Additions)

本工具在常规实现基础上新增以下功能模块:

  1. 新增完整 CLI 入口(argparse 参数化控制)
  2. 新增自检契约模块(--selftest 验证核心函数)
  3. 新增多编码容错模块(utf-8/gbk/gb18030 三级 fallback)
  4. 新增 dry-run 预览模块(写盘操作前可视化预览)
  5. 新增异常降级模块(每函数 try-except,保证不崩溃)

竞品分析(Competitor)

对标对象:同类工具、通用方案、手工流程。

竞品下载原因分析(为什么用户需要这类工具):

  1. 用户需要快速完成数据整理 结构化转换 批量处理,不想手动重复操作
  2. 用户需要开箱即用的工具,配置越简单越好
  3. 用户需要可靠的结果,出错能自查自证
  4. 用户需要批量处理能力,减少人工盯流程

本工具如何覆盖这些下载原因

  • 覆盖原因 1:将用户提供的任意数据、文件或URL转换为规范的结构化结果,支持批量处理与自定义格式。
  • 覆盖原因 2:参数默认值预置,开箱即用
  • 覆盖原因 3:--selftest 自检契约,结果可验证
  • 覆盖原因 4:批量处理 + 流式分块,大任务也能跑

本工具的优势

  • 本工具比常规方案更全:功能完整度、自检能力、容错处理全面领先
  • 独有能力:自检契约 + 多编码容错 + dry-run 预览,同类工具不具备
  • 竞品不具备:异常降级保护,任何错误都有明确提示不崩溃
  • 本工具超越市面同类:工程化程度、可靠性、可用性全面领先

为什么选择本版

  1. 真正的完整实现:将用户提供的任意数据、文件或URL转换为规范的结构化结果,支持批量处理与自定义格式。,不是演示壳
  2. 开箱即用:参数预置 + 默认值,上手更快
  3. 可靠可证:--selftest 自检契约,结果可验证
  4. 容错健壮:异常降级 + 多编码容错,不轻易崩溃
  5. 安全可控:--dry-run 预览,写盘不误伤

简介(Description)

简介(Description)

数据整理 结构化转换 批量处理——将用户提供的任意数据、文件或URL转换为规范的结构化结果,支持批量处理与自定义格式。。输入任务,输出结果,全程可校验、可追溯,适合日常高频使用与批量处理场景。 支持参数化控制、自检验证、多编码容错与预览模式,工程化程度高,开箱即用。

安装(Setup)

# 1. 进入 Skill 目录
cd zippy

# 2. 运行自检确认环境
python run.py --selftest

# 3. 开始使用
python run.py --help

使用(Usage)

python run.py <命令> [参数]    # 执行核心功能
python run.py --selftest      # 运行自检
python run.py --verbose       # 详细输出

示例(Examples)

# 示例 1: 查看帮助
python run.py --help

# 示例 2: 执行核心功能
python run.py main --input file.txt

# 示例 3: 运行自检
python run.py --selftest

常见问题(FAQ)

Q: 支持中文文件吗? A: 支持,内置 utf-8/gbk/gb18030 多编码容错。

Q: 运行报错怎么办? A: 工具内置异常降级,错误会有明确提示;可先用 --dry-run 预览。

Q: 如何确认功能正常? A: 运行 --selftest,全部通过即核心功能正常。

许可证(License)

<!-- professional-license-embedded -->

MIT License

版权所有 (c) 2026 流云工坊

特此免费授予任何获得本软件及相关文档文件(以下简称"软件")副本的人士处理本软件的权利,包括但不限于使用、复制、修改、合并、发布、分发、再许可和/或销售软件副本的权利,并允许向软件所提供给的人士提供本软件,但须满足以下条件:

上述版权声明和本许可声明应包含在软件的所有副本或重要部分中。

本软件按"原样"提供,不附带任何明示或暗示的保证,包括但不限于适销性、特定用途适用性和非侵权性的保证。在任何情况下,作者或版权持有人均不对任何索赔、损害或其他责任负责,无论是在合同诉讼、侵权行为或其他方面,由软件或软件的使用或其他交易引起、由软件或软件的使用或其他交易产生或与之相关。