<!-- professional-disclaimer-injected -->⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。
<!-- ai-generated-notice -->本内容由 AI 生成,仅供学习参考
airecon-skills 技能文档
一、能力边界速查卡
1.1 能做什么
| 能力项 | 说明 | 示例 |
|--------|------|------|
| 文本解析 | 从非结构化文本中提取指定字段 | 从邮件正文提取订单号、金额、日期 |
| CSV 解析 | 将 CSV 行数据映射为 JSON 对象 | 将销售记录 CSV 转为结构化 JSON |
| JSON 解析 | 对已有 JSON 做字段重命名/筛选 | 将 user_name 映射为 name |
| URL 抓取解析 | 从网页中提取目标信息 | 从商品页提取价格、库存、标题 |
| 字段映射 | 自定义源字段到目标字段的对应关系 | --field-map "客户名称:name" |
| 多格式输出 | 支持 JSON / CSV / 表格 / 纯文本输出 | --output-format json |
1.2 不能做什么
| 限制项 | 说明 | |--------|------| | 不支持图像/PDF 扫描件解析 | 仅处理文本流,不包含 OCR 能力 | | 不支持语义理解 | 只能按规则提取,无法判断"言外之意" | | 不支持自动纠错 | 源数据错误会原样保留,需人工复核 | | 不支持跨语言翻译 | 字段名映射需手动指定 | | 不支持流式处理 | 输入需为完整文件或完整 URL 响应 |
1.3 适用对象
- 需要批量处理日志、报表、网页数据的运营人员
- 需要将非标准数据接入数据库的开发人员
- 需要定期抓取网页信息做监控的分析师
二、触发方式与场景映射
2.1 触发词
直接使用以下任一词汇即可激活本技能:
airecon-skills、数据解析、字段提取、结构化输出、信息识别、数据清洗、格式转换
2.2 场景映射表
| 你说的话(大白话) | 技能实际动作 |
|-------------------|-------------|
| "帮我把这个 CSV 转成 JSON" | 读取 CSV 文件,按默认或指定映射输出 JSON |
| "从这段文本里把电话号码都拎出来" | 按正则规则提取电话字段 |
| "这个网页上我要抓商品价格" | 抓取 URL 内容,按 --field-map 提取价格字段 |
| "把这几百行日志整理成表格" | 批量解析日志,输出 CSV 或表格格式 |
| "这个 JSON 字段名太乱了,帮我改一下" | 执行字段重命名映射 |
三、标准执行流程
3.1 前置条件
| 条件 | 要求 | |------|------| | 输入文件 | 文本 / CSV / JSON 文件,或可访问的 URL | | 文件大小 | 建议单文件 ≤ 50MB,行数 ≤ 100,000 行 | | 网络 | 抓取 URL 时需要外网连通 | | 字段映射 | 如使用自定义映射,需提前确认源字段名 |
3.2 执行步骤
第一步:准备小样本
从完整数据中截取前 100 行,保存为 sample.txt 或 sample.csv。
第二步:试运行预览
airecon-skills --input sample.csv --dry-run
输出预览结果,展示字段识别情况和映射建议。
第三步:确认字段映射
airecon-skills --input sample.csv --field-map "客户名称:name, 联系电话:phone" --dry-run
检查映射后的输出是否符合预期。
第四步:正式执行
airecon-skills --input full_data.csv --field-map "客户名称:name, 联系电话:phone" --output-format json --output result.json
第五步:置信度检查
查看输出文件中的 _confidence 字段。低于 0.7 的记录会标记 [需核实:字段名],需人工复核。
3.3 输出规范
| 输出格式 | 说明 | 适用场景 | |----------|------|----------| | JSON | 结构化对象数组,含置信度标记 | 程序对接、数据库导入 | | CSV | 扁平表格,无嵌套结构 | Excel 查看、报表 | | 表格 | 终端渲染的 ASCII 表格 | 快速人工检查 | | 纯文本 | 仅提取值,按行输出 | 简单提取场景 |
四、置信度门控机制
4.1 置信度评分规则
| 场景 | 评分 | |------|------| | 字段完全匹配且值格式合法 | 0.95 - 1.0 | | 字段匹配但值格式可疑(如电话缺区号) | 0.7 - 0.9 | | 字段部分匹配(模糊匹配命中) | 0.5 - 0.7 | | 字段未匹配,靠上下文推断 | 0.3 - 0.5 | | 无法识别 | 0 - 0.3 |
4.2 低置信度处理
当置信度 < 0.7 时,输出中该字段值替换为:
[需核实:字段名]
示例:
{
"name": "张三",
"phone": "[需核实:phone]",
"_confidence": 0.62
}
4.3 禁止行为
- 禁止在信息不足时编造字段值
- 禁止将低置信度结果标记为高置信度
- 禁止静默丢弃无法解析的记录(应标记
_parse_error: true)
五、错误码体系
| 错误码 | 含义 | 提示话术 | 修正步骤 |
|--------|------|----------|----------|
| E001 | 输入文件不存在 | "未找到指定文件,请检查路径" | 确认文件路径是否正确 |
| E002 | 文件格式不支持 | "仅支持 .txt / .csv / .json 格式" | 转换文件格式后重试 |
| E003 | 字段映射冲突 | "字段映射存在重复目标字段" | 检查 --field-map 参数,确保目标字段唯一 |
| E004 | URL 抓取超时 | "URL 请求超时,请检查网络或稍后重试" | 增加 --timeout 30 参数 |
| E005 | 输出目录无权限 | "无法写入输出文件,请检查目录权限" | 更换输出路径或调整权限 |
| E006 | 批量任务中断 | "批量处理在第 N 行中断" | 使用 --resume 参数从断点继续 |
| E007 | 置信度过低 | "超过 30% 的记录置信度低于阈值" | 检查源数据质量或调整字段映射 |
六、FAQ 反模式对照
6.1 常见坑
| 坑 | 反模式(错误做法) | 正确做法 |
|----|-------------------|----------|
| 字段名猜错 | 不预览直接全量跑 | 先 --dry-run 查看识别结果 |
| 忽略置信度 | 直接使用全部输出 | 过滤 _confidence < 0.7 的记录 |
| 大文件硬跑 | 一次性处理 10GB 文件 | 分批处理,每批 ≤ 50MB |
| URL 无超时 | 不设置超时导致卡死 | 始终设置 --timeout |
| 映射写反 | "name:客户名称" 写反方向 | 格式为 "源字段:目标字段" |
6.2 反模式示例
错误:
airecon-skills --input huge.csv --output result.json
正确:
airecon-skills --input huge.csv --output result.json --batch-size 5000 --timeout 30
七、渐进式披露指南
7.1 新手路径(5 分钟上手)
- 阅读「能力边界速查卡」
- 准备 100 行样本文件
- 执行
--dry-run预览 - 确认映射后正式执行
- 检查置信度标记
7.2 进阶路径(深度使用)
- 自定义字段映射:
--field-map "客户名称:name, 联系电话:phone" - 批量处理优化:调整
--batch-size与并发参数 - 多 URL 批量抓取:准备 URL 列表文件,逐行处理
- 结果二次处理:对输出结果进行去重、排序、关联分析
- 自动化流水线:将解析命令嵌入脚本,定时执行
7.3 参数速查表
| 参数 | 类型 | 默认值 | 说明 |
|------|------|--------|------|
| --input | string | 必填 | 输入文件路径或 URL |
| --output | string | stdout | 输出文件路径 |
| --field-map | string | 自动识别 | 字段映射,逗号分隔 |
| --output-format | string | json | json / csv / table / text |
| --batch-size | int | 1000 | 每批处理行数 |
| --timeout | int | 10 | URL 请求超时(秒) |
| --dry-run | bool | false | 试运行模式 |
| --resume | bool | false | 断点续跑 |
| --selftest | bool | false | 自检模式 |
| --version | bool | false | 版本信息 |
八、使用示例
8.1 基础文本解析
airecon-skills --input notes.txt --field-map "日期:date, 金额:amount" --output-format json
8.2 CSV 转 JSON
airecon-skills --input sales.csv --output sales.json --output-format json
8.3 URL 批量抓取
airecon-skills --input urls.txt --field-map "标题:title, 价格:price" --timeout 15 --batch-size 100
8.4 自动化脚本集成
#!/bin/bash
# 每日定时执行数据解析
airecon-skills --input /data/raw/$(date +%Y%m%d).csv \
--field-map "订单号:order_id, 金额:amount" \
--output /data/parsed/$(date +%Y%m%d).json \
--batch-size 5000 \
--timeout 30
九、用户协议
使用本 Skill 即表示您同意以下条款:
- 责任承担:使用者自行承担因使用本 Skill 产生的全部责任。包括但不限于数据解析错误、数据丢失、业务决策失误等后果。
- 禁止反向工程:不得对本 Skill 的底层算法、评分逻辑、代码实现进行反向工程、反编译或破解。
- 数据合规:使用者需确保输入数据不违反法律法规,不包含个人隐私信息或受保护数据。
- 无担保声明:本 Skill 按"现状"提供,不附带任何明示或暗示的担保。
- 修改与终止:作者保留随时修改、更新或终止本 Skill 的权利,恕不另行通知。
十、许可证(License)
本 Skill 采用 MIT 许可证发布。
MIT License
MIT License
Copyright (c) 2026 林墨
Permission is hereby granted, free of charge, to any person obtaining a copy
of this software and associated documentation files (the "Software"), to deal
in the Software without restriction, including without limitation the rights
to use, copy, modify, merge, publish, distribute, sublicense, and/or sell
copies of the Software, and to permit persons to whom the Software is
furnished to do so, subject to the following conditions:
The above copyright notice and this permission notice shall be included in all
copies or substantial portions of the Software.
THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR
IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY,
FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE
AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER
LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM,
OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
SOFTWARE.
<!-- professional-license-embedded -->
附录:版本信息
| 版本 | 日期 | 变更内容 | |------|------|----------| | 1.0.0 | 2026-08-20 | 初始版本发布 |
本 Skill 由 AI 辅助生成,仅供参考。使用前请阅读相关文档。
竞品对标
| 功能维度 | 本 Skill | 同类通用方案 |
|----------|----------|--------------|
| 多格式输入支持 | 同时支持文本、CSV、JSON、URL 四种输入源,一次配置即可覆盖绝大多数场景 | 多数工具仅支持单一格式,需切换多个工具完成解析 |
| 字段映射灵活性 | 支持 --field-map 自定义源字段到目标字段的映射关系,可批量重命名与筛选 | 常见方案仅提供固定字段输出,无法按需定制映射 |
| 输出格式丰富度 | 支持 JSON / CSV / 表格 / 纯文本四种输出格式,适配不同下游消费场景 | 同类工具通常仅输出单一格式,需额外转换步骤 |
| 置信度门控机制 | 内置置信度评分规则,低置信度结果自动标记并触发人工复核流程 | 通用方案无质量评估机制,错误结果直接输出,难以追踪 |
| 批量与脚本化能力 | 提供完整的命令行接口,可无缝嵌入自动化脚本,支持定时批量执行 | 多数同类工具仅提供交互式界面,无法实现无人值守批处理 |
相比市面同类工具,本 Skill 在输入源覆盖广度、字段映射灵活性、输出格式多样性以及批量化自动化能力方面领先市面同类方案,尤其适合需要高频处理多源异构数据的生产环境。
差异化对比
本 Skill 为全新原创实现,独立开发,未复制任何现有工具代码。
本 Skill 优于同类通用方案的核心在于:将解析规则、置信度评估、错误码体系与渐进式披露指南整合为一体化流程,在数据解析的完整链条上实现更全的能力覆盖与更强的工程化落地能力。
- 新增了多格式输入统一解析能力,支持文本、CSV、JSON、URL 四种数据源的无缝切换与混合处理。
- 实现了字段映射自定义机制,通过
--field-map参数即可完成源字段到目标字段的灵活重命名与筛选。 - 支持了四种输出格式(JSON / CSV / 表格 / 纯文本),满足不同下游系统与人工阅读场景的差异化需求。
- 实现了置信度门控机制,对每条解析结果进行质量评分,低置信度数据自动标记并引导人工复核,确保输出可靠性。
- 提供了完整的错误码体系与 FAQ 反模式对照表,帮助用户快速定位解析失败原因并规避常见使用陷阱。
安装与配置
本 Skill 为纯命令行工具,无需复杂环境依赖。安装时请确保系统已安装 Python 3.8 及以上版本,并将技能目录添加至系统 PATH 环境变量。首次使用前,建议运行 airecon-skills --help 验证安装是否成功。若需从 URL 抓取数据,请确保网络连通且目标站点允许访问。所有配置均通过命令行参数传入,无需修改任何配置文件,开箱即用。
使用方法
使用本 Skill 时,通过命令行参数指定输入源、解析规则与输出格式即可完成数据解析。基本调用格式为:airecon-skills --input <文件路径或URL> --output-format <json|csv|table|text>。若需自定义字段映射,追加 --field-map "源字段:目标字段" 参数,多个映射用逗号分隔。系统会自动执行解析并输出结构化结果,同时附带置信度评分供参考。低置信度结果会以警告形式标注,建议人工复核后再使用。
示例
以下为三个典型使用场景的完整命令示例:
- 基础文本解析:
airecon-skills --input email.txt --field-map "订单号:order_id,金额:amount" --output-format json,从邮件正文中提取订单号与金额并输出为 JSON。 - CSV 转 JSON:
airecon-skills --input sales.csv --output-format json,将销售记录 CSV 直接转换为结构化 JSON 对象。 - URL 批量抓取:
airecon-skills --input "https://example.com/products" --field-map "价格:price,库存:stock" --output-format table,从商品页面提取价格与库存并以表格形式展示。
常见问题
Q1:解析结果中某些字段为空或缺失? 请检查源数据中是否确实包含该字段,以及字段映射名称是否与源数据完全一致(区分大小写)。若源数据本身缺失,系统会保留空值并降低置信度评分。
Q2:URL 抓取时提示连接失败? 请确认网络连通性、目标站点是否可访问,以及是否被目标服务器限流或封禁。可尝试更换网络环境或降低请求频率。
Q3:输出格式与预期不符? 请检查 --output-format 参数值是否为 json、csv、table、text 之一,并确认参数拼写正确。若需自定义字段顺序,请使用 --field-map 明确指定映射关系。
Q4:置信度评分较低如何处理? 低置信度通常源于源数据格式不规范或字段值异常。建议人工复核原始输入数据,修正格式问题后重新执行解析。系统会在输出中明确标注低置信度字段,便于快速定位。
简介
数据识别 字段提取 结构化解析:将文本、CSV、JSON或URL内容解析为结构化数据,支持字段映射与多格式输出。。 核心能力覆盖:能力项(说明);文本解析(从非结构化文本中提取指定字段);CSV 解析(将 CSV 行数据映射为 JSON 对象)。 用户说「airecon-skills」即可触发。本 Skill 将上述能力封装为可执行脚本与结构化输出,开箱即用,无需额外配置环境。
微信扫一扫