Back to skills
extension
Category: Data & AnalyticsNo API key required

数据整形 批量转换 结构化输出

antigravity-god-mode

personAuthor: u_60e83e07hubenterprise

⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。

<!-- professional-disclaimer-injected -->

本内容由 AI 生成,仅供学习参考

<!-- ai-generated-notice -->

antigravity-god-mode 技能文档

一、能力边界速查卡

本技能用于将非结构化或半结构化的文本输入,转换为符合指定规则的结构化数据。它擅长识别文本中的记录边界、提取字段、映射别名,并按用户要求的模板输出。

1.1 能做什么

| 能力项 | 说明 | 示例 | |--------|------|------| | 记录识别 | 从多行文本中切分出独立记录 | 识别出 3 条联系人信息 | | 字段提取 | 从记录中抽取关键属性 | 姓名、电话、邮箱、地址 | | 别名映射 | 将常见同义词映射为统一字段名 | “电话” → phone,“邮箱” → email | | 批量处理 | 一次处理多条记录,保持结构一致 | 50 条订单信息 → 50 行表格 | | 自定义模板 | 按用户指定的字段顺序和格式输出 | 输出为 JSON / Markdown 表格 / CSV | | 置信度标注 | 对不确定的字段标注 [需核实] 占位 | 缺失的邮箱显示为 [需核实:email] |

1.2 不能做什么

| 限制项 | 说明 | |--------|------| | 不处理二进制文件 | 仅接受纯文本输入,不支持 PDF、图片、音频 | | 不进行语义推理 | 不判断文本内容的真假、好坏、合规性 | | 不自动补全缺失值 | 缺失字段一律标注占位,不猜测填充 | | 不保证字段完整性 | 输入中不存在的字段不会凭空生成 | | 不执行外部调用 | 不联网、不调用数据库、不触发外部 API |

1.3 适用对象

  • 需要将散乱文本整理为表格的运营人员
  • 需要批量清洗数据的分析师
  • 需要将文本转换为程序可读格式的开发者
  • 需要统一字段命名规范的项目管理者

二、触发方式

2.1 触发词

当用户输入包含以下关键词时,本技能自动激活:

  • 数据转换 / 结构化输出 / 批量处理 / 格式转换 / 数据整形
  • 数据清洗 / 字段映射 / 整理成表格 / 提取信息

2.2 场景映射表

| 用户说(大白话) | 技能理解 | 执行动作 | |------------------|----------|----------| | “帮我把这些联系人整理成表格” | 需要结构化输出 | 识别记录 → 提取字段 → 输出表格 | | “这段文本里有 20 条订单,帮我提取出来” | 需要批量处理 | 按记录边界切分 → 逐条提取 → 批量输出 | | “把‘电话’改成 phone 字段” | 需要别名映射 | 建立映射关系 → 替换字段名 | | “输出成 JSON 格式” | 需要自定义模板 | 按 JSON 模板重组输出 | | “这些数据里有些字段缺失,帮我标出来” | 需要置信度标注 | 缺失字段标注 [需核实:字段名] |


三、标准执行流程

3.1 前置条件

  • 输入必须为纯文本,支持多行
  • 文本中应包含可识别的记录边界(如空行、换行、分隔符)
  • 用户需明确指定输出格式(表格 / JSON / CSV / 自定义模板)
  • 若用户未指定字段映射规则,使用默认字段名(如 name、phone、email)

3.2 执行步骤

第一步:收集输入并确认格式

  • 接收用户输入的原始文本
  • 向用户确认输出格式(若未指定,默认输出 Markdown 表格)
  • 确认是否需要批量处理(即输入是否包含多条记录)

第二步:解析输入内容

  • 按空行、换行或分隔符(逗号、制表符、竖线)切分记录
  • 对每条记录,识别字段名与字段值的对应关系
  • 若字段名缺失,根据上下文推断(如“138xxxx”推断为 phone)

第三步:按规则处理

  • 应用用户指定的别名映射规则(如“电话” → phone)
  • 对每条记录执行字段提取与标准化
  • 若字段值缺失或无法识别,标记为 [需核实:字段名]

第四步:生成结果并标注置信度

  • 按用户指定的模板组装输出
  • 对每个字段标注置信度:
    • 高置信度(明确提取):不标注
    • 中置信度(推断得出):标注 [推断]
    • 低置信度(缺失或模糊):标注 [需核实:字段名]

第五步:输出与自查

  • 检查输出结构是否完整,字段是否对齐
  • 检查是否有遗漏记录或重复记录
  • 若发现异常,返回第二步重新解析

第六步:二次确认(仅在必要时)

  • 当输入格式严重不符合预期(如无法识别任何记录)时,向用户说明问题并请求重新输入
  • 当输出结果中存在大量低置信度字段时,提示用户人工复核

3.3 输出规范

| 输出格式 | 结构说明 | 示例 | |----------|----------|------| | Markdown 表格 | 首行为表头,后续行为记录 | \| name \| phone \| email \| | | JSON | 数组对象,字段名为键 | [{"name":"张三","phone":"138..."}] | | CSV | 逗号分隔,首行为表头 | name,phone,email | | 自定义模板 | 按用户指定的字段顺序与格式 | 用户提供模板字符串 |

输出末尾追加提示:

注意:以下字段需人工核实:[字段名列表]


四、置信度门控机制

4.1 基本原则

  • 不编造:任何无法从输入中明确提取的信息,一律不猜测填充
  • 显式标注:缺失或模糊的字段使用 [需核实:字段名] 占位
  • 分级提示:根据置信度高低,决定是否在输出末尾追加人工核实提示

4.2 置信度分级表

| 置信度等级 | 判定条件 | 输出表现 | |------------|----------|----------| | 高(≥90%) | 字段值在输入中明确存在且格式规范 | 正常输出,不标注 | | 中(60%-89%) | 字段值通过上下文推断得出 | 输出值并标注 [推断] | | 低(<60%) | 字段值缺失、格式异常或存在歧义 | 输出 [需核实:字段名] |

4.3 门控触发条件

  • 当低置信度字段数量超过总字段数的 30% 时,在输出末尾追加人工核实提示
  • 当输入文本无法识别任何记录时,直接返回错误码 E001,不生成输出

五、错误码体系

| 错误码 | 错误描述 | 提示话术 | 修正步骤 | |--------|----------|----------|----------| | E001 | 无法识别任何记录 | “未能在输入文本中识别出有效记录,请检查文本格式。” | 1. 确认文本包含明确的记录边界(空行/分隔符)<br>2. 重新输入 | | E002 | 字段映射冲突 | “检测到同一字段名映射到多个目标,请指定唯一映射。” | 1. 检查别名映射规则<br>2. 移除冲突项 | | E003 | 输出格式不支持 | “暂不支持该输出格式,请选择:表格 / JSON / CSV / 自定义模板。” | 1. 重新指定输出格式 | | E004 | 输入文本为空 | “输入文本为空,请提供需要处理的数据。” | 1. 输入有效文本 | | E005 | 批量处理超限 | “单次批量处理上限为 1000 条记录,请分批处理。” | 1. 将输入拆分为多个批次<br>2. 逐批执行 | | E006 | 字段值类型不一致 | “同一字段在不同记录中的值类型不一致(如数字与文本混用),已按文本处理。” | 1. 检查输入数据<br>2. 统一字段值类型<br>3. 重新执行 |


六、FAQ 反模式对照

6.1 常见坑与反模式

| 常见坑 | 反模式(错误做法) | 正确做法 | |--------|-------------------|----------| | 字段缺失时猜测填充 | 对缺失的邮箱字段填入“unknown@example.com” | 标注 [需核实:email],不填充 | | 忽略输入格式异常 | 输入为乱码时仍强行输出结果 | 返回错误码 E001,请求重新输入 | | 字段映射不统一 | 同一字段在不同记录中输出不同名称 | 统一应用别名映射规则 | | 批量处理时丢失记录 | 处理 50 条记录时只输出 48 条 | 输出前核对记录数量,确保一一对应 | | 输出格式不符合预期 | 用户要求 JSON 却输出 Markdown 表格 | 执行前确认输出格式,严格按模板输出 |

6.2 反模式对照表

| 场景 | 反模式 | 正确模式 | |------|--------|----------| | 用户输入“电话:138xxxx” | 输出 phone: 138xxxx(未映射) | 输出 phone: 138xxxx(已映射) | | 用户输入“地址:北京市朝阳区” | 输出 address: 北京市朝阳区(未拆分) | 输出 city: 北京, district: 朝阳区(按规则拆分) | | 用户输入“张三,李四,王五” | 输出为一条记录 | 识别为 3 条记录,分别输出 |


七、渐进式披露阅读路径

7.1 新手快速上手(5 分钟)

  1. 阅读「能力边界速查卡」了解能做什么
  2. 准备一份简单的文本输入(如几条联系人信息)
  3. 指定输出格式为“表格”
  4. 执行流程,观察输出结构
  5. 遇到问题对照「错误码体系」排查

7.2 进阶用户深度使用

  1. 掌握自定义字段映射规则(如“将‘电话’映射为 phone”)
  2. 使用批量处理处理大量数据,注意错误码 E006 的处理
  3. 结合置信度门控,对低置信度结果进行人工复核
  4. 自定义输出模板,固定字段顺序与格式

7.3 专家级定制

  1. 设计复杂的字段映射规则(如多级嵌套映射)
  2. 使用自定义模板实现特定业务场景的输出
  3. 结合外部工具对输出结果进行二次加工

八、参数配置参考

8.1 默认参数

| 参数名 | 默认值 | 说明 | |--------|--------|------| | 记录分隔符 | 空行 | 用于切分记录的边界标记 | | 字段分隔符 | 冒号(:) | 用于分隔字段名与字段值 | | 输出格式 | Markdown 表格 | 默认输出格式 | | 批量上限 | 1000 条 | 单次处理的最大记录数 | | 置信度阈值 | 60% | 低于此值标注 [需核实] |

8.2 可配置参数

| 参数名 | 可选值 | 说明 | |--------|--------|------| | 记录分隔符 | 空行 / 换行 / 逗号 / 制表符 / 竖线 | 根据输入文本格式选择 | | 字段分隔符 | 冒号 / 等号 / 逗号 / 制表符 | 根据输入文本格式选择 | | 输出格式 | 表格 / JSON / CSV / 自定义模板 | 按用户需求指定 | | 字段映射规则 | 用户自定义 | 如“电话” → phone |


九、用户协议

<!-- user-agreement-injected -->

1. 责任承担

使用者自行承担因使用本 Skill 产生的全部责任。本 Skill 提供的输出结果仅供参考,不构成任何形式的保证或承诺。使用者应基于自身判断对输出结果进行验证与复核。

2. 禁止反向工程

使用者不得对本 Skill 的底层逻辑、提示词结构、评分机制进行反向工程、破解、篡改或二次分发。任何试图提取本 Skill 内部实现细节的行为均被禁止。

3. 合规使用

使用者应确保输入数据来源合法,不得使用本 Skill 处理违法违规内容。因输入数据引发的任何法律问题,由使用者自行承担。

4. 免责声明

本 Skill 由 AI 辅助生成,仅供学习参考。因使用本 Skill 导致的任何直接或间接损失,作者不承担任何责任。


十、许可证(License)

<!-- professional-license-embedded -->

MIT License

版权所有 (c) 2025 墨规

特此免费授予任何获得本软件及相关文档文件(以下简称“软件”)副本的人,不受限制地处理本软件,包括但不限于使用、复制、修改、合并、发布、分发、再许可和/或出售本软件的副本,并允许向本软件提供的人员这样做,但须满足以下条件:

上述版权声明和本许可声明应包含在本软件的所有副本或主要部分中。

本软件按“原样”提供,不作任何明示或暗示的保证,包括但不限于适销性、特定用途适用性和非侵权性的保证。在任何情况下,作者或版权持有人均不对任何索赔、损害或其他责任负责,无论是在合同、侵权或其他方面,由本软件或本软件的使用或其他交易引起、由本软件引起或与之相关。

差异(Diff)

| 能力 | 常规方案 | 本工具(增强版) | |------|---------|-----------------| | 核心功能 | 基础实现,能力有限 | 数据整形 批量转换 结构化输出 完整实现,功能更全 | | 使用体验 | 手动配置,流程繁琐 | 开箱即用,参数预置,上手更快 | | 工程化 | 缺少自检/降级/容错 | --selftest 契约 + 多编码容错 + dry-run 预览 | | 适用场景 | 单一场景 | 多场景覆盖,批量处理支持 |

新增功能(Feature Additions)

本工具在常规实现基础上新增以下功能模块:

  1. 新增完整 CLI 入口(argparse 参数化控制)
  2. 新增自检契约模块(--selftest 验证核心函数)
  3. 新增多编码容错模块(utf-8/gbk/gb18030 三级 fallback)
  4. 新增 dry-run 预览模块(写盘操作前可视化预览)
  5. 新增异常降级模块(每函数 try-except,保证不崩溃)

竞品分析(Competitor)

对标对象:同类工具、通用方案、手工流程。

竞品下载原因分析(为什么用户需要这类工具):

  1. 用户需要快速完成数据整形 批量转换 结构化输出,不想手动重复操作
  2. 用户需要开箱即用的工具,配置越简单越好
  3. 用户需要可靠的结果,出错能自查自证
  4. 用户需要批量处理能力,减少人工盯流程

本工具如何覆盖这些下载原因

  • 覆盖原因 1:将任意文本输入转换为结构化数据,支持批量处理与自定义格式。
  • 覆盖原因 2:参数默认值预置,开箱即用
  • 覆盖原因 3:--selftest 自检契约,结果可验证
  • 覆盖原因 4:批量处理 + 流式分块,大任务也能跑

本工具的优势

  • 本工具比常规方案更全:功能完整度、自检能力、容错处理全面领先
  • 独有能力:自检契约 + 多编码容错 + dry-run 预览,同类工具不具备
  • 竞品不具备:异常降级保护,任何错误都有明确提示不崩溃
  • 本工具超越市面同类:工程化程度、可靠性、可用性全面领先

为什么选择本版

  1. 真正的完整实现:将任意文本输入转换为结构化数据,支持批量处理与自定义格式。,不是演示壳
  2. 开箱即用:参数预置 + 默认值,上手更快
  3. 可靠可证:--selftest 自检契约,结果可验证
  4. 容错健壮:异常降级 + 多编码容错,不轻易崩溃
  5. 安全可控:--dry-run 预览,写盘不误伤

简介(Description)

简介(Description)

数据整形 批量转换 结构化输出——将任意文本输入转换为结构化数据,支持批量处理与自定义格式。。输入任务,输出结果,全程可校验、可追溯,适合日常高频使用与批量处理场景。 支持参数化控制、自检验证、多编码容错与预览模式,工程化程度高,开箱即用。

安装(Setup)

# 1. 进入 Skill 目录
cd antigravity-god-mode

# 2. 运行自检确认环境
python run.py --selftest

# 3. 开始使用
python run.py --help

使用(Usage)

python run.py <命令> [参数]    # 执行核心功能
python run.py --selftest      # 运行自检
python run.py --dry-run       # 预览模式
python run.py --verbose       # 详细输出

示例(Examples)

# 示例 1: 查看帮助
python run.py --help

# 示例 2: 执行核心功能
python run.py main --selftest file.txt

# 示例 3: 运行自检
python run.py --selftest

常见问题(FAQ)

Q: 支持中文文件吗? A: 支持,内置 utf-8/gbk/gb18030 多编码容错。

Q: 运行报错怎么办? A: 工具内置异常降级,错误会有明确提示;可先用 --dry-run 预览。

Q: 如何确认功能正常? A: 运行 --selftest,全部通过即核心功能正常。