返回 Skill 列表
extension
分类: 数据与分析无需 API Key

数据解析 结构化提取 信息校验

将任意文本解析为结构化JSON,标注置信度并输出缺失字段清单。

person作者: user_2fd890c9hubcommunity

⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。

<!-- professional-disclaimer-injected -->

本内容由 AI 生成,仅供学习参考

<!-- ai-generated-notice -->

APE 技能手册

一、能力边界速查卡

APE 是一个文本结构化解析工具,帮助你把非结构化的输入(如日志、邮件、用户反馈、原始记录)转换为带置信度标注的 JSON 输出,并明确告知哪些信息缺失。

1.1 能做什么

| 能力项 | 说明 | |--------|------| | 文本解析 | 从自由文本中提取实体、属性、关系,输出为 JSON | | 置信度标注 | 每个字段附带 confidence 值(0.0~1.0),表示可信程度 | | 缺失检测 | 输出 missing 数组,列出未能识别的字段名 | | 占位符标记 | 对不确定内容输出 [需核实:字段名] 占位,不编造数据 | | 批量处理 | 多行文本逐行解析,每行独立输出结果 | | Schema 定制 | 通过 --schema 参数定义自定义字段结构 | | 阈值过滤 | 通过 --min-confidence 过滤低置信度结果 |

1.2 不能做什么

| 限制项 | 说明 | |--------|------| | 不执行代码 | 不运行输入中的任何代码片段 | | 不访问外部数据 | 不联网查询、不调用外部 API 补全信息 | | 不保证语义理解 | 对隐喻、反讽、上下文依赖的文本识别能力有限 | | 不处理非文本输入 | 不支持图片、音频、视频等多媒体格式 | | 不自动修正数据 | 发现错误时仅标记,不擅自修改原始内容 |

1.3 适用对象

  • 需要快速清洗日志数据的运维人员
  • 需要从用户反馈中提取结构化信息的运营人员
  • 需要将非标准文本接入下游系统的开发人员
  • 需要批量整理历史记录的数据分析人员

二、触发方式与场景映射

2.1 触发词

核心触发词:ape解析结构化数据提取信息整理

补充触发词:字段抽取文本清洗信息识别

2.2 场景映射表

| 你说的话(大白话) | APE 实际做的事 | |-------------------|---------------| | "帮我把这段客户反馈整理成表格" | 解析文本,提取客户名、产品名、情绪倾向、问题描述等字段 | | "这些日志太乱了,帮我理一理" | 识别时间戳、错误码、IP 地址、请求路径等关键信息 | | "把这几封邮件里的联系人信息抽出来" | 提取姓名、邮箱、电话、公司名等联系人字段 | | "这个 CSV 里有些列是空的,帮我标出来" | 对每行数据检测缺失字段,输出缺失清单 | | "批量处理一下这些订单记录" | 逐行解析订单信息,输出结构化 JSON 数组 |


三、标准执行流程

3.1 前置条件

  • 输入文本为 UTF-8 编码
  • 单条文本长度不超过 10,000 字符
  • 批量处理时,每行视为一条独立记录(以换行符 \n 分隔)
  • 如需自定义字段,提前准备 JSON Schema 文件

3.2 执行步骤

第一步:接收输入

直接传入文本,或通过管道传入文件内容。

# 单条文本
ape "张三在2024年3月15日购买了价值500元的商品A"

# 批量处理(每行一条)
ape < records.txt

# 自定义 Schema
ape --schema custom_schema.json "李四的邮箱是 lisi@example.com"

第二步:解析与提取

系统自动执行以下操作:

  1. 识别文本中的实体(人名、地名、组织名、日期、金额等)
  2. 根据默认 Schema 或自定义 Schema 匹配字段
  3. 计算每个字段的置信度
  4. 标记缺失字段

第三步:输出结果

输出为 JSON 格式,结构如下:

{
  "data": {
    "person": "张三",
    "date": "2024-03-15",
    "amount": 500,
    "product": "商品A"
  },
  "confidence": {
    "person": 0.98,
    "date": 0.95,
    "amount": 0.92,
    "product": 0.88
  },
  "missing": ["order_id", "payment_method"],
  "placeholders": 0,
  "suggestions": [
    "缺少订单号,建议补充以完成订单追踪",
    "缺少支付方式,建议确认付款渠道"
  ]
}

3.3 输出规范

| 字段 | 类型 | 说明 | |------|------|------| | data | object | 解析出的结构化数据 | | confidence | object | 每个字段的置信度(0.0~1.0) | | missing | array | 缺失字段名列表 | | placeholders | integer | 输出中占位符 [需核实:字段] 的数量 | | suggestions | array | 针对缺失字段的下一步建议 |

3.4 下一步建议生成规则

| 缺失字段类型 | 建议内容 | |-------------|---------| | 必填字段 | "缺少{字段名},建议补充以完成{相关流程}" | | 选填字段 | "缺少{字段名},如适用请补充" | | 关联字段 | "缺少{字段名},可能影响{关联功能}的准确性" |


四、置信度门控机制

4.1 置信度分级

| 置信度范围 | 等级 | 处理方式 | |-----------|------|---------| | 0.9 ~ 1.0 | 高可信 | 直接使用,无需人工复核 | | 0.7 ~ 0.89 | 中可信 | 建议人工复核,标注为"待确认" | | 0.5 ~ 0.69 | 低可信 | 输出 [需核实:字段名] 占位符 | | < 0.5 | 不可信 | 不输出该字段,加入 missing 列表 |

4.2 占位符规则

当信息不足时,APE 不会编造数据,而是输出 [需核实:字段名] 占位符。例如:

{
  "data": {
    "person": "张三",
    "date": "[需核实:date]"
  },
  "confidence": {
    "person": 0.95,
    "date": 0.45
  },
  "placeholders": 1
}

4.3 阈值过滤

使用 --min-confidence 参数过滤低质量数据:

ape --min-confidence 0.8 < input.txt

低于阈值的字段将被移入 missing 列表,不进入 data 对象。


五、错误码体系

| 错误码 | 含义 | 提示话术 | 修正步骤 | |--------|------|---------|---------| | E001 | 输入为空 | "未检测到输入文本,请提供需要解析的内容" | 检查输入是否为空文件或空字符串 | | E002 | 输入超长 | "单条文本超过10,000字符限制,请拆分后重试" | 将长文本按段落或逻辑拆分为多条 | | E003 | Schema 无效 | "自定义 Schema 格式错误,请检查 JSON 合法性" | 使用 jq 或在线工具验证 Schema 格式 | | E004 | 编码不支持 | "输入文本编码不是 UTF-8,请转换后重试" | 使用 iconv 命令转换编码 | | E005 | 解析超时 | "解析超时,文本复杂度超出处理能力" | 简化输入文本,或拆分处理 | | E006 | 批量处理中断 | "第 N 行解析失败,已跳过该行继续处理" | 检查第 N 行文本格式,修正后重新处理 |


六、FAQ 反模式对照

6.1 常见坑与正确做法

| 常见错误(反模式) | 问题说明 | 正确做法 | |-------------------|---------|---------| | 直接使用低置信度数据 | 置信度低于 0.7 的数据可能不准确 | 设置 --min-confidence 0.8 或人工复核 | | 忽略 missing 字段 | 缺失字段可能导致下游流程失败 | 根据 suggestions 补充必要信息 | | 输入包含多种语言混写 | 混合语言降低识别准确率 | 尽量统一语言,或分条处理 | | 依赖 APE 补全缺失信息 | APE 只标记不补全,不会编造数据 | 从原始数据源获取缺失信息 | | 批量处理时未检查每行结果 | 单行失败不影响整体,但可能被忽略 | 检查每行输出的 missingconfidence |

6.2 反模式示例

反模式: 直接使用 APE 输出作为最终数据,不检查置信度。

# 错误做法
ape "张三 2024年3月15日 500元" > result.json
# 直接使用 result.json 中的数据

# 正确做法
ape --min-confidence 0.8 "张三 2024年3月15日 500元" > result.json
# 检查 result.json 中的 confidence 和 missing 字段

七、渐进式披露阅读路径

7.1 新手快速上手(5 分钟)

  1. 阅读「能力边界速查卡」了解 APE 能做什么
  2. 查看「场景映射表」找到你的使用场景
  3. 运行基础命令:ape "你的文本"
  4. 查看输出中的 dataconfidence 字段

7.2 进阶用户(30 分钟)

  1. 学习「标准执行流程」中的参数配置
  2. 使用 --schema 自定义字段结构
  3. 设置 --min-confidence 过滤低质量数据
  4. 阅读「错误码体系」处理异常情况
  5. 参考「FAQ 反模式对照」避免常见错误

7.3 高级集成(2 小时)

  1. 将 APE 输出接入 CI/CD 管道
  2. 编写脚本处理批量结果中的低置信度模式
  3. 根据 suggestions 字段自动触发数据补全流程
  4. 结合错误码实现自动化重试机制

八、参数速查表

| 参数 | 类型 | 默认值 | 说明 | |------|------|--------|------| | --schema | string | 内置默认 | 自定义 JSON Schema 文件路径 | | --min-confidence | float | 0.0 | 置信度阈值,低于此值的字段移入 missing | | --selftest | boolean | false | 运行自检程序 | | --version | boolean | false | 显示版本信息 | | --output | string | stdout | 输出文件路径 | | --format | string | json | 输出格式(json/jsonl) |


九、用户协议

<!-- user-agreement-injected -->

使用 APE 技能即表示您同意以下条款:

  1. 责任承担:使用者自行承担使用本 Skill 产生的全部责任。包括但不限于因解析结果不准确、数据丢失、业务决策失误等造成的任何直接或间接损失。

  2. 禁止反向工程:不得对本 Skill 进行反向工程、反编译、破解、篡改或试图提取源代码。

  3. 合规使用:使用者应确保使用本 Skill 的行为符合当地法律法规及所在组织的政策要求。

  4. 无担保声明:本 Skill 按"现状"提供,不附带任何明示或暗示的担保。

  5. 数据安全:使用者应自行评估输入数据的敏感性,本 Skill 不承担数据泄露责任。


十、许可证(License)

<!-- professional-license-embedded -->

MIT License

版权所有 (c) 2024 林默

特此免费授予任何获得本软件及相关文档文件(以下简称"软件")副本的人士使用、复制、修改、合并、发布、分发、再许可及/或出售软件副本的权利,但须满足以下条件:

上述版权声明和本许可声明应包含在软件的所有副本或实质性部分中。

本软件按"现状"提供,不附带任何明示或暗示的担保,包括但不限于适销性、特定用途适用性和非侵权性的担保。在任何情况下,作者或版权持有人均不对任何索赔、损害或其他责任负责,无论是在合同、侵权或其他方面,由软件或软件的使用或其他交易引起,或与之相关。


本 Skill 由 AI 辅助生成,仅供参考。使用前请阅读相关文档。