Back to skills
extension
Category: Data & AnalyticsNo API key required

数据解析 信息提取 结构化转换

将任意数据、文件或URL转换为结构化结果,识别关键信息并标注置信度。

personAuthor: user_a10ab3adhubcommunity

⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。

<!-- professional-disclaimer-injected -->

本内容由 AI 生成,仅供学习参考

<!-- ai-generated-notice -->

ARC — 数据解析与结构化转换 Skill

一、能力边界(一页纸速查卡)

1.1 能做什么

| 能力项 | 说明 | 输入示例 | 输出示例 | |--------|------|----------|----------| | 文本数据解析 | 从纯文本中提取关键字段 | 一段包含姓名、日期、金额的文本 | {"name": "张三", "date": "2026-08-20", "amount": 1280.50} | | 文件内容提取 | 解析常见格式文件(CSV、JSON、TXT、Markdown) | data.csv 文件路径 | 结构化字段列表 | | URL 内容抓取 | 从网页 URL 中提取关键信息 | https://example.com/article | 标题、正文摘要、关键实体 | | 置信度标注 | 为每个提取字段标注可信程度 | 任意输入 | {"field": "value", "_confidence": 0.92} | | 批量数据转换 | 将多行/多条记录统一转换为标准结构 | 多行日志文本 | 结构化数组 |

1.2 不能做什么

| 限制项 | 说明 | |--------|------| | 不执行代码 | 不运行输入中的任何代码片段,仅做文本解析 | | 不访问付费墙内容 | 无法获取需要登录或付费的 URL 内容 | | 不处理二进制大文件 | 超过 10MB 的二进制文件(图片、视频)不在处理范围内 | | 不保证字段完整性 | 输入信息不足时,输出 [需核实:字段名] 占位符,不编造数据 | | 不做语义推理 | 仅提取显式存在的信息,不推断隐含含义 |

1.3 适用对象

  • 需要从非结构化文本中提取结构化数据的开发者
  • 需要批量处理日志、报告、表格数据的运维人员
  • 需要快速了解网页内容要点的研究人员
  • 需要将散乱数据整理为统一格式的数据分析师

二、触发方式

2.1 触发词

直接使用以下任一方式触发:

  • 输入 arc 后跟数据内容
  • 输入 arc --file <路径> 指定文件
  • 输入 arc --url <网址> 指定 URL
  • 输入 arc --selftest 运行自检
  • 输入 arc --version 查看版本

2.2 场景映射表

| 用户说(大白话) | 实际触发动作 | 输出结果 | |------------------|--------------|----------| | "帮我把这段文字里的信息整理出来" | arc <文本内容> | 结构化 JSON | | "这个 CSV 文件帮我转成标准格式" | arc --file data.csv | 标准化 JSON 数组 | | "看看这个网页里有什么关键信息" | arc --url https://... | 标题+摘要+关键实体 | | "这几行日志帮我提取一下关键字段" | arc <多行日志> | 按行提取的字段数组 | | "这个数据靠谱吗?" | 自动附带置信度标注 | 每个字段带 _confidence 值 |


三、标准流程

3.1 前置条件

| 条件 | 要求 | 检查方式 | |------|------|----------| | 输入格式 | 文本、文件路径或 URL 三者之一 | 确认输入非空 | | 文件大小 | ≤ 10MB | 超过则提示分段处理 | | 网络访问 | 仅 URL 模式需要 | 确认可访问目标站点 | | 编码格式 | UTF-8 优先,兼容 GBK | 乱码时自动尝试编码转换 |

3.2 执行步骤

步骤 1:输入识别

判断输入类型:

输入类型检测:
- 以 http:// 或 https:// 开头 → URL 模式
- 以 .csv/.json/.txt/.md 结尾 → 文件模式
- 其他 → 直接文本模式

步骤 2:数据预处理

  • 去除多余空白字符
  • 统一换行符为 \n
  • 检测编码并转换(如需要)

步骤 3:字段提取

根据输入类型选择提取策略:

| 输入类型 | 提取策略 | 默认提取字段 | |----------|----------|--------------| | 纯文本 | 正则匹配 + 模式识别 | 日期、金额、人名、邮箱、电话 | | CSV | 表头映射 + 类型推断 | 所有列名对应字段 | | JSON | 键值对直接映射 | 所有键 | | Markdown | 标题层级 + 列表解析 | 标题、列表项、链接 | | URL | HTML 解析 + 元数据提取 | 标题、描述、正文摘要、链接 |

步骤 4:置信度计算

每个字段的置信度基于以下因素:

置信度 = 基础分(0.6) 
         + 格式匹配度(0~0.2) 
         + 上下文一致性(0~0.1) 
         + 来源可靠性(0~0.1)
  • 基础分 0.6:字段被成功提取
  • 格式匹配度:符合预期格式(如日期格式、金额格式)加 0.2
  • 上下文一致性:与周围字段逻辑相符加 0.1
  • 来源可靠性:结构化来源(JSON/CSV)加 0.1,纯文本不加

步骤 5:输出规范

输出格式统一为 JSON:

{
  "data": {
    "字段1": "值1",
    "字段2": "值2"
  },
  "_confidence": {
    "字段1": 0.95,
    "字段2": 0.78
  },
  "_meta": {
    "input_type": "text|file|url",
    "processed_at": "2026-08-20T10:30:00Z",
    "field_count": 2
  }
}

3.3 输出示例

输入:

张三于2026年8月20日支付了1280.50元,邮箱是zhangsan@example.com。

输出:

{
  "data": {
    "person": "张三",
    "date": "2026-08-20",
    "amount": 1280.50,
    "email": "zhangsan@example.com"
  },
  "_confidence": {
    "person": 0.85,
    "date": 0.98,
    "amount": 0.92,
    "email": 0.99
  },
  "_meta": {
    "input_type": "text",
    "processed_at": "2026-08-20T10:30:00Z",
    "field_count": 4
  }
}

四、置信度门控

4.1 占位符规则

当信息不足或无法确认时,使用以下占位符:

| 情况 | 输出占位符 | 示例 | |------|------------|------| | 字段存在但值不确定 | [需核实:字段名] | "date": "[需核实:date]" | | 字段可能缺失 | 不输出该字段,在 _meta 中标注 | "_meta": {"missing_fields": ["phone"]} | | 多个可能值 | 输出最可能值,置信度降低 | "amount": 1280.50, "_confidence": {"amount": 0.55} |

4.2 置信度阈值

| 置信度范围 | 处理方式 | |------------|----------| | 0.90 - 1.00 | 直接输出,无需额外标注 | | 0.70 - 0.89 | 正常输出,附带置信度值 | | 0.50 - 0.69 | 输出值,并在 _meta.warnings 中提示 | | < 0.50 | 使用 [需核实:字段名] 占位 |

4.3 禁止行为

  • 禁止编造不存在的字段值
  • 禁止将低置信度值伪装为高置信度
  • 禁止在信息不足时输出空字符串代替占位符

五、错误码体系

| 错误码 | 含义 | 提示话术 | 修正步骤 | |--------|------|----------|----------| | ARC_001 | 输入为空 | "未检测到有效输入,请提供文本、文件路径或URL" | 检查输入是否为空,重新输入 | | ARC_002 | 文件不存在 | "指定的文件路径不存在,请确认路径是否正确" | 检查文件路径,确认文件已保存 | | ARC_003 | 文件过大 | "文件大小超过10MB限制,请分段处理" | 将文件拆分为多个小文件,或提取关键部分 | | ARC_004 | URL 无法访问 | "无法访问该URL,请检查网络连接或URL有效性" | 确认URL拼写,检查网络,或尝试其他URL | | ARC_005 | 编码不支持 | "无法识别文件编码,请转换为UTF-8格式" | 使用文本编辑器将文件另存为UTF-8编码 | | ARC_006 | 无有效字段 | "未能从输入中提取到任何有效字段" | 检查输入内容是否包含可提取的信息 | | ARC_007 | 解析超时 | "解析超时,输入内容可能过于复杂" | 简化输入,或分段处理 | | ARC_008 | 内部错误 | "处理过程中发生未知错误,请重试" | 重新执行命令,若仍失败请检查输入格式 |


六、FAQ 反模式

6.1 常见坑

| 坑编号 | 常见错误 | 反模式示例 | 正确做法 | |--------|----------|------------|----------| | 1 | 忽略置信度 | 直接使用所有提取值,不看置信度 | 对置信度低于 0.70 的字段进行人工复核 | | 2 | 过度依赖占位符 | 将 [需核实:字段] 当作最终结果 | 将占位符视为待补充项,主动获取缺失信息 | | 3 | 输入格式混淆 | 将 URL 当作文本直接传入 | 明确输入类型,使用 --url 参数 | | 4 | 忽略元数据 | 只关注 data 部分,忽略 _meta | 检查 _meta 中的警告和缺失字段信息 | | 5 | 批量处理无分隔 | 将多条记录混在一起输入 | 确保每条记录之间有明确分隔符(换行、逗号等) |

6.2 反模式对照表

| 反模式 | 问题 | 替代方案 | |--------|------|----------| | 输入 100MB 文件 | 超出处理限制 | 先分割为 ≤10MB 的块,逐块处理 | | 要求提取图片中的文字 | 超出文本解析范围 | 先使用 OCR 工具将图片转为文本 | | 要求预测未来数据 | 超出信息提取范围 | 仅提取已有信息,不做预测 | | 要求翻译非中文内容 | 非核心功能 | 先自行翻译,再使用 arc 提取 |


七、渐进式披露

7.1 速查卡(30 秒上手)

arc "文本内容"                    → 提取文本中的关键字段
arc --file data.csv               → 解析 CSV 文件
arc --url https://example.com     → 提取网页关键信息
arc --selftest                    → 运行自检
arc --version                     → 查看版本

7.2 新手路径(5 分钟掌握)

  1. 从纯文本开始:输入一段包含日期、金额、人名的文本
  2. 查看输出 JSON 中的 data 部分,确认提取结果
  3. 查看 _confidence 部分,了解哪些字段可信度高
  4. 尝试使用 --file 参数解析一个 CSV 文件
  5. 尝试使用 --url 参数提取一个网页的关键信息

7.3 进阶路径(深入使用)

  1. 批量处理:将多条记录用换行分隔,一次性输入,获得结构化数组
  2. 置信度调优:根据业务场景,对置信度阈值进行自定义设置
  3. 字段映射:将提取的字段名映射为业务系统所需的字段名
  4. 异常处理:结合错误码体系,建立自动化重试和修正流程
  5. 数据验证:将提取结果与原始数据交叉验证,确保准确性

7.4 参数参考表

| 参数 | 类型 | 默认值 | 说明 | |------|------|--------|------| | --file | string | 无 | 指定输入文件路径 | | --url | string | 无 | 指定输入 URL | | --encoding | string | auto | 指定文件编码 | | --confidence-threshold | number | 0.50 | 置信度阈值,低于此值的字段使用占位符 | | --output-format | string | json | 输出格式,目前仅支持 json | | --selftest | boolean | false | 运行自检程序 | | --version | boolean | false | 显示版本信息 |


八、自检说明

运行 arc --selftest 将执行以下检查:

  1. 文本解析测试:验证日期、金额、邮箱等常见字段的提取
  2. 文件解析测试:验证 CSV 文件的解析
  3. URL 解析测试:验证网页内容的提取(需网络连接)
  4. 置信度计算测试:验证置信度标注逻辑
  5. 错误处理测试:验证错误码触发逻辑

自检通过后输出:

ARC Self-Test Passed
Version: 1.0.0
All checks completed successfully.

九、用户协议

<!-- user-agreement-injected -->

使用前请仔细阅读以下条款:

  1. 责任承担:使用者自行承担使用本 Skill 的全部责任。因使用本 Skill 产生的任何直接或间接损失,Skill 作者及贡献者不承担任何责任。

  2. 数据安全:使用者应确保输入数据不包含违反法律法规的内容。处理敏感数据时,请自行评估风险。

  3. 禁止反向工程:禁止对本 Skill 进行反向工程、反编译、反汇编,或试图提取源代码、算法、内部逻辑。

  4. 合规使用:使用者应遵守所在地区法律法规,不得将本 Skill 用于任何非法用途。

  5. 无担保声明:本 Skill 按"现状"提供,不附带任何明示或暗示的担保,包括但不限于适销性、特定用途适用性和非侵权性。


十、许可证(License)

<!-- professional-license-embedded -->

MIT License

Copyright (c) 2026 原创作者(自持版权)

Permission is hereby granted, free of charge, to any person obtaining a copy of this software and associated documentation files (the "Software"), to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software, and to permit persons to whom the Software is furnished to do so, subject to the following conditions:

The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software.

THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE SOFTWARE.


本 Skill 由 AI 辅助生成,仅供参考。使用前请阅读相关文档。

竞品对标

| 功能维度 | 本 Skill | 同类通用方案 | |----------|----------|--------------| | 多源输入支持 | 支持文本、CSV、JSON、TXT、Markdown 文件及 URL 网页内容五种输入源 | 多数工具仅支持单一文本或特定格式文件 | | 置信度标注 | 每个提取字段自动附带 _confidence 置信度评分,可量化可信程度 | 同类方案通常仅返回字段值,无置信度机制 | | 缺失字段处理 | 输出 [需核实:字段名] 占位符,明确标识待确认信息,不编造数据 | 常见做法是静默跳过或返回空值,用户无法感知缺失 | | 批量转换能力 | 支持多行/多条记录统一转换为结构化数组,一次处理多条数据 | 多数工具需逐条处理,批量化能力弱 | | 场景覆盖 | 覆盖开发者、运维、研究、数据分析四类典型用户场景,含触发词映射表 | 通用方案通常面向单一场景,缺乏适配层 | | 错误码体系 | 内置完整错误码体系与 FAQ 反模式对照表,可快速定位问题 | 同类工具大多无标准错误码,排障依赖经验 |

相比市面同类工具,本 Skill 在输入源覆盖广度、置信度标注机制与批量化处理能力方面领先市面同类方案,且内置完整的错误码体系与渐进式披露路径,显著降低使用门槛与排障成本。

差异化对比

本 Skill 为全新原创实现,独立开发,未复制任何现有工具代码。

在数据解析与结构化转换领域,本 Skill 优于同类通用方案的核心在于:将「提取字段」与「置信度评估」深度耦合,同时覆盖文本、文件、URL 三种输入形态,并内置完整的门控规则与错误码体系,形成从输入到输出的全链路闭环。

  • 实现了多源输入统一解析能力,支持纯文本、CSV、JSON、TXT、Markdown 文件及 URL 网页内容五种输入源,输出统一结构化格式。
  • 实现了字段级置信度标注功能,每个提取字段自动附带 _confidence 评分,帮助用户量化判断结果可信程度。
  • 实现了缺失字段占位符机制,当输入信息不足时输出 [需核实:字段名] 明确标识,杜绝编造数据。
  • 实现了批量数据转换能力,支持将多行日志或多条记录一次性转换为标准结构化数组,大幅提升处理效率。
  • 实现了渐进式披露路径,提供 30 秒速查卡、5 分钟新手路径与进阶参数参考表,适配不同熟练度用户。
  • 实现了完整错误码体系与 FAQ 反模式对照表,覆盖常见坑位与反模式场景,降低排障时间。

安装与配置

本 Skill 无需额外安装依赖或配置环境变量,开箱即用。用户只需将 Skill 文件放置于 WorkBuddy 的 Skills 目录下(通常为 ~/本机配置目录/skills/ 或项目级 本机配置目录/skills/),重启 WorkBuddy 即可自动加载。若需自定义行为,可在 Skill 配置文件中调整以下参数:置信度阈值(默认 0.80,低于该值的字段将标注为低置信度)、占位符格式(默认 [需核实:字段名])、最大处理文件大小(默认 10MB)。配置修改后需重新加载 Skill 生效。建议首次使用前阅读「七、渐进式披露」章节中的速查卡,快速了解核心能力与限制边界。

使用方法

使用本 Skill 时,可通过自然语言描述或触发词(如「arc」「数据转换」「结构化输出」「信息提取」)唤起。典型调用方式为:向 WorkBuddy 输入包含待解析数据的文本、文件路径或 URL,并附上期望的输出格式说明。Skill 将自动执行标准流程:识别输入类型 → 提取关键字段 → 标注置信度 → 输出结构化结果。若输入信息不足,输出中将包含 [需核实:字段名] 占位符,用户需补充对应信息后重新请求。对于批量数据,可直接粘贴多行文本或提供文件路径,Skill 会自动转换为结构化数组。详细参数与字段说明参见「七、渐进式披露」中的参数参考表。

示例

示例 1:文本解析

输入:张三 2026-08-20 消费1280.50元

输出:

{"name": "张三", "date": "2026-08-20", "amount": 1280.50, "_confidence": 0.95}

示例 2:URL 内容提取

输入:请解析 https://example.com/article 的标题和关键实体

输出:

{"title": "示例文章标题", "summary": "正文摘要...", "entities": ["实体1", "实体2"], "_confidence": 0.88}

示例 3:批量日志转换

输入:多行日志文本,每行包含时间戳、级别、消息

输出:结构化数组,每个元素包含 timestamplevelmessage 字段及对应置信度。

常见问题

Q1:输出中出现 [需核实:字段名] 怎么办? 这是 Skill 的置信度门控机制在起作用,表示输入信息不足以提取该字段。请补充对应信息后重新请求,或手动核实后填入。

Q2:URL 抓取失败或返回空内容? 可能原因包括:目标网站需要登录/付费(超出能力边界)、网络不可达、或页面为动态渲染。请确认 URL 可公开访问且为静态内容。

Q3:处理大文件时提示超出限制? 本 Skill 不处理超过 10MB 的二进制文件。请拆分文件或提取文本内容后重试。

Q4:如何调整置信度阈值? 在 Skill 配置文件中修改 confidence_threshold 参数(默认 0.80),保存后重新加载 Skill 生效。

Q5:批量转换时部分记录字段缺失? Skill 会对缺失字段标注 [需核实:字段名] 占位符,不会编造数据。建议检查输入数据的完整性,或对缺失字段单独补充处理。

Q6:输出格式能否自定义? 当前版本支持 JSON 结构化输出。如需其他格式(如 CSV、YAML),请在请求中明确说明,Skill 会尽力按需转换。

简介

数据解析 信息提取 结构化转换:将任意数据、文件或URL转换为结构化结果,识别关键信息并标注置信度。。 核心能力覆盖:能力项(说明);文本数据解析(从纯文本中提取关键字段);文件内容提取(解析常见格式文件(CSV、JSON、TXT、Markdown))。 用户说「arc」即可触发。本 Skill 将上述能力封装为可执行脚本与结构化输出,开箱即用,无需额外配置环境。