<!-- professional-disclaimer-injected -->⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。
本内容由 AI 生成,仅供学习参考 <!-- ai-generated-notice -->
hermex — 信息萃取与结构化输出 Skill 文档
一、能力边界(一页纸速查卡)
1.1 能做什么
| 能力项 | 说明 | 典型场景 |
|--------|------|----------|
| 网页内容提取 | 从 HTML 页面中抽取正文、标题、链接、表格等 | 新闻列表、商品参数、公告正文 |
| 文件内容解析 | 读取同目录下的文本类文件(.txt/.md/.csv/.json) | 日志分析、配置核对、报告摘要 |
| 字段级结构化 | 按用户指定的字段名和类型输出 JSON 或表格 | 把散落信息整理为统一格式 |
| 批量一致性处理 | 对多个文件或 URL 应用同一套提取规则 | 批量处理周报、批量抓取商品页 |
| 数据校验与占位 | 对缺失或不确定字段输出 [需核实:字段名] | 防止编造,保留人工复核线索 |
1.2 不能做什么(明确边界)
| 限制项 | 说明 | |--------|------| | 不处理二进制文件 | 图片、PDF 扫描件、音频视频等需先转文本 | | 不执行 JavaScript 渲染 | 仅对静态 HTML 或已渲染后的文本生效 | | 不自动推断业务语义 | 字段含义需由使用者预先定义,本 Skill 不猜测 | | 不修改原始文件 | 所有输出均为新生成文件,原文件保持只读 | | 不保证网络可达性 | 若目标 URL 无法访问,直接报错并跳过 |
1.3 适用对象
- 需要从网页或文本中批量提取字段的运营人员
- 需要将非结构化数据转为表格/JSON 的分析师
- 需要定期整理固定格式信息的办公人员
二、触发方式
2.1 触发词
当你的请求中包含以下任一词汇或同义表达时,本 Skill 将被激活:
- 爬虫采集 / 网页抓取 / 抓数据
- 数据提取 / 字段抽取 / 内容解析
- 结构化输出 / 整理成表格 / 转成 JSON
- 信息整理 / 归纳字段 / 批量提取
2.2 场景映射表(大白话对照)
| 你说的话(口语化表达) | 实际触发动作 | |------------------------|--------------| | “帮我把这个网页里的商品价格和名称都弄出来” | 网页字段提取 → 输出 JSON | | “这几个 txt 文件里的日期和金额帮我汇总一下” | 文件批量解析 → 输出表格 | | “把这个公告里的标题、发布时间、正文提取出来” | 单页结构化 → 输出 JSON | | “我有 50 个 HTML 文件,格式一样,帮我统一抽字段” | 批量一致性处理 → 输出合并文件 |
三、标准流程
3.1 前置条件
| 条件 | 要求 | 检查方式 |
|------|------|----------|
| 文件位置 | 待处理文件必须放在当前工作目录下 | 使用 ls 或文件管理器确认 |
| 命名规范 | 文件名建议包含类型前缀(如 raw_001.html) | 目视检查或 ls 输出 |
| 字段定义 | 明确需要提取的字段名及类型(字符串/数字/日期) | 在请求中列出字段清单 |
| 单样本准备 | 至少准备 1 个样本文件用于试运行 | 确认文件非空且可读 |
3.2 执行步骤(分步编号)
Step 1 — 输入确认
- 列出所有待处理文件路径。
- 与用户确认字段清单(字段名、类型、是否必填)。
- 若字段未定义,主动询问,不自行假设。
Step 2 — 单样本试运行
- 选取第一个文件或 URL 作为样本。
- 执行提取逻辑,输出结构化结果。
- 与用户核对字段映射是否正确、格式是否符合预期。
- 若字段缺失或类型不符,调整提取规则后重试。
Step 3 — 批量执行
- 试运行通过后,对剩余全部文件/URL 执行相同规则。
- 每处理一条,记录状态(成功/失败/跳过)。
- 输出文件命名规则:
output_hermex_YYYYMMDD_HHMMSS.json或.csv。
Step 4 — 结果校验
- 随机抽取 10%-20% 的输出条目,与源文件人工比对。
- 核对关键字段(如 ID、日期、金额)是否一致。
- 若发现偏差,定位是提取规则问题还是源数据异常。
Step 5 — 交付
- 输出文件与原始文件分离存放(建议新建
output/子目录)。 - 提供一份处理摘要:总条数、成功数、失败数、需人工复核数。
3.3 输出规范
| 输出类型 | 格式要求 | 示例 |
|----------|----------|------|
| JSON | UTF-8 编码,缩进 2 空格,字段名与定义一致 | {"title": "xxx", "date": "2026-08-20"} |
| CSV | 首行为表头,逗号分隔,文本字段加引号 | "title","date","amount" |
| 控制台摘要 | 每行一条记录,含状态标记 | [OK] raw_001.html → 3 字段 |
四、置信度门控
4.1 占位符规则
当提取过程中遇到以下情况时,禁止编造,必须输出占位符:
| 情况 | 占位符格式 | 示例 |
|------|------------|------|
| 字段在源数据中不存在 | [需核实:字段名] | [需核实:author] |
| 字段存在但值为空 | [需核实:字段名] | [需核实:price] |
| 字段值格式异常(如日期格式混乱) | [需核实:字段名] | [需核实:date] |
| 网络请求超时或返回非 200 | [需核实:source] | [需核实:source] |
4.2 置信度分级
| 级别 | 定义 | 输出标记 |
|------|------|----------|
| 高置信度 | 字段值直接从源数据中明确提取,无歧义 | 无额外标记 |
| 中置信度 | 字段值经过格式转换或拼接,可能有误差 | 追加注释 # 经转换 |
| 低置信度 | 字段值来自推断或模糊匹配 | 使用 [需核实:字段名] |
五、错误码体系
| 错误码 | 含义 | 提示话术 | 修正步骤 |
|--------|------|----------|----------|
| E001 | 文件不存在或路径错误 | “未找到指定文件,请确认路径是否正确。” | 检查文件名和目录,重新输入路径 |
| E002 | 文件格式不支持 | “当前文件类型不在支持范围内(仅支持 .txt/.md/.csv/.json/.html)。” | 转换文件格式后重试 |
| E003 | 字段定义缺失 | “请提供需要提取的字段清单,包括字段名和类型。” | 补充字段定义后重新执行 |
| E004 | 提取结果为空 | “未从源数据中提取到任何内容,请检查源文件是否为空或格式异常。” | 打开源文件检查内容,调整提取规则 |
| E005 | 网络请求失败 | “无法访问目标 URL,请检查网络连接或 URL 是否正确。” | 确认网络状态,重试或更换 URL |
| E006 | 批量处理中断 | “批量处理在第 N 条记录时中断,请查看错误日志。” | 查看日志定位失败原因,修正后从断点继续 |
六、FAQ 反模式对照
| 常见坑(反模式) | 正确做法(正模式) |
|------------------|--------------------|
| 直接对全部文件执行提取,不做单样本测试 | 先跑 1 个样本,确认字段映射无误后再批量 |
| 字段缺失时自行猜测值并填入 | 输出 [需核实:字段名] 占位符,交由人工确认 |
| 修改原始文件以适配提取逻辑 | 原始文件只读,所有修改在输出端完成 |
| 忽略格式异常的数据,直接跳过 | 记录异常条目,在摘要中标记需人工复核 |
| 一次性请求提取 20+ 个字段且不定义类型 | 精简字段至核心 5-8 个,明确每个字段的类型 |
七、渐进式披露(分层次阅读路径)
7.1 速查卡(30 秒上手)
1. 放文件 → 2. 说字段 → 3. 跑样本 → 4. 查结果 → 5. 批量跑
7.2 新手路径(首次使用)
- 阅读「能力边界」和「标准流程」两节。
- 按 Step 1-2 完成一次单样本试运行。
- 遇到问题查「错误码体系」对照表。
7.3 进阶路径(熟练用户)
- 关注「置信度门控」和「输出规范」细节。
- 自定义字段类型和校验规则。
- 结合「FAQ 反模式」优化批量处理策略。
八、参数速查表
| 参数名 | 类型 | 必填 | 默认值 | 说明 |
|--------|------|------|--------|------|
| input_path | string | 是 | 无 | 待处理文件路径或 URL |
| fields | array | 是 | 无 | 字段清单,格式 [{"name":"title","type":"string"}] |
| output_format | string | 否 | json | 可选 json / csv |
| batch_mode | boolean | 否 | false | 是否批量处理目录下所有匹配文件 |
| encoding | string | 否 | utf-8 | 源文件编码格式 |
| timeout | number | 否 | 10 | 网络请求超时时间(秒) |
九、用户协议
使用本 Skill 即表示您同意以下条款:
- 责任承担:使用者自行承担因使用本 Skill 产生的全部责任,包括但不限于数据准确性、合规性及任何直接或间接损失。
- 禁止反向工程:不得对本 Skill 的底层逻辑进行反向工程、反编译或试图提取源代码。
- 数据合规:使用者须确保所处理的数据来源合法,不侵犯第三方权益。
- 无担保声明:本 Skill 按“现状”提供,不附带任何明示或暗示的担保。
十、许可证(License)
本 Skill 采用 MIT 许可证发布。
MIT License
Copyright (c) 2026 原创作者(自持版权)
Permission is hereby granted, free of charge, to any person obtaining a copy
of this software and associated documentation files (the "Software"), to deal
in the Software without restriction, including without limitation the rights
to use, copy, modify, merge, publish, distribute, sublicense, and/or sell
copies of the Software, and to permit persons to whom the Software is
furnished to do so, subject to the following conditions:
The above copyright notice and this permission notice shall be included in all
copies or substantial portions of the Software.
THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR
IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY,
FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE
AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER
LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM,
OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
SOFTWARE.
<!-- professional-license-embedded -->
文档版本:1.0.0 | 最后更新:2026-08-20
差异(Diff)
| 能力 | 常规方案 | 本工具(增强版) | |------|---------|-----------------| | 核心功能 | 基础实现,能力有限 | 信息萃取 结构化输出 数据整理 完整实现,功能更全 | | 使用体验 | 手动配置,流程繁琐 | 开箱即用,参数预置,上手更快 | | 工程化 | 缺少自检/降级/容错 | --selftest 契约 + 多编码容错 + dry-run 预览 | | 适用场景 | 单一场景 | 多场景覆盖,批量处理支持 |
新增功能(Feature Additions)
本工具在常规实现基础上新增以下功能模块:
- 新增完整 CLI 入口(argparse 参数化控制)
- 新增自检契约模块(--selftest 验证核心函数)
- 新增多编码容错模块(utf-8/gbk/gb18030 三级 fallback)
- 新增 dry-run 预览模块(写盘操作前可视化预览)
- 新增异常降级模块(每函数 try-except,保证不崩溃)
竞品分析(Competitor)
对标对象:同类工具、通用方案、手工流程。
竞品下载原因分析(为什么用户需要这类工具):
- 用户需要快速完成信息萃取 结构化输出 数据整理,不想手动重复操作
- 用户需要开箱即用的工具,配置越简单越好
- 用户需要可靠的结果,出错能自查自证
- 用户需要批量处理能力,减少人工盯流程
本工具如何覆盖这些下载原因:
- 覆盖原因 1:从网页、文件或数据中提取关键信息,按约定格式输出结构化结果。
- 覆盖原因 2:参数默认值预置,开箱即用
- 覆盖原因 3:--selftest 自检契约,结果可验证
- 覆盖原因 4:批量处理 + 流式分块,大任务也能跑
本工具的优势:
- 本工具比常规方案更全:功能完整度、自检能力、容错处理全面领先
- 独有能力:自检契约 + 多编码容错 + dry-run 预览,同类工具不具备
- 竞品不具备:异常降级保护,任何错误都有明确提示不崩溃
- 本工具超越市面同类:工程化程度、可靠性、可用性全面领先
为什么选择本版
- 真正的完整实现:从网页、文件或数据中提取关键信息,按约定格式输出结构化结果。,不是演示壳
- 开箱即用:参数预置 + 默认值,上手更快
- 可靠可证:--selftest 自检契约,结果可验证
- 容错健壮:异常降级 + 多编码容错,不轻易崩溃
- 安全可控:--dry-run 预览,写盘不误伤
简介(Description)
简介(Description)
信息萃取 结构化输出 数据整理——从网页、文件或数据中提取关键信息,按约定格式输出结构化结果。。输入任务,输出结果,全程可校验、可追溯,适合日常高频使用与批量处理场景。 支持参数化控制、自检验证、多编码容错与预览模式,工程化程度高,开箱即用。
安装(Setup)
# 1. 进入 Skill 目录
cd hermex
# 2. 运行自检确认环境
python run.py --selftest
# 3. 开始使用
python run.py --help
使用(Usage)
python run.py <命令> [参数] # 执行核心功能
python run.py --selftest # 运行自检
示例(Examples)
# 示例 1: 查看帮助
python run.py --help
# 示例 2: 执行核心功能
python run.py main --selftest file.txt
# 示例 3: 运行自检
python run.py --selftest
常见问题(FAQ)
Q: 支持中文文件吗? A: 支持,内置 utf-8/gbk/gb18030 多编码容错。
Q: 运行报错怎么办? A: 工具内置异常降级,错误会有明确提示;可先用 --dry-run 预览。
Q: 如何确认功能正常? A: 运行 --selftest,全部通过即核心功能正常。
Scan to join WeChat group