<!-- professional-disclaimer-injected -->⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。
random-finders 技能文档
一、能力边界速查卡
1.1 能做什么
| 编号 | 能力项 | 说明 | 适用场景示例 | |------|--------|------|--------------| | C1 | 数据转结构化 | 将用户提供的文本、表格、URL 内容解析为统一字段结构 | 网页信息抽取、日志整理、问卷开放题归类 | | C2 | 关键信息识别 | 自动提取人名、日期、编号、金额、地址等实体信息 | 客户名单整理、订单信息汇总 | | C3 | 约定格式输出 | 按用户指定的字段顺序、分隔符、文件类型生成结果 | 生成 CSV、JSON、Markdown 表格 | | C4 | 置信度标注 | 对每条输出记录标注可信程度(高/中/低) | 数据清洗、OCR 结果校验 | | C5 | 批量处理 | 支持多文件、多 URL 的循环处理,保持格式一致 | 批量抓取网页标题、批量整理通讯录 |
1.2 不能做什么
| 编号 | 限制项 | 说明 | |------|--------|------| | L1 | 不执行网络请求 | 技能本身不主动访问外部 URL,需用户提供内容或预先下载 | | L2 | 不进行语义推理 | 不判断文本情感倾向、不生成摘要、不做观点归纳 | | L3 | 不修改原始文件 | 所有输出均为新生成文件,原始数据保持只读 | | L4 | 不处理加密内容 | 加密压缩包、密码保护的文档需用户先行解密 | | L5 | 不保证字段完整性 | 源数据缺失时,输出对应字段留空并标注 [需核实] |
1.3 适用对象
- 需要将散乱数据整理为表格的运营人员
- 需要批量提取网页信息的调研人员
- 需要统一多来源数据格式的数据分析初学者
- 需要快速核对数据完整性的质量管理人员
二、触发方式与场景映射
2.1 触发词
| 触发词 | 使用场景 | |--------|----------| | random finders | 直接调用技能主命令 | | 随机查找 | 中文场景下的功能调用 | | 数据整理 | 当用户表达"帮我整理一下这些数据"时触发 | | 结构化输出 | 当用户要求"转成表格/JSON"时触发 |
2.2 场景映射表
| 用户说(大白话) | 技能执行动作 | |------------------|--------------| | "帮我把这个网页里的联系方式提取出来" | 解析用户粘贴的网页文本 → 提取电话/邮箱/地址 → 输出表格 | | "这批订单号帮我核对一下格式" | 读取用户提供的订单列表 → 检查格式规范 → 标注异常项 | | "把这三个 CSV 合并成一个,统一列名" | 读取多个 CSV → 映射字段 → 合并输出 | | "这个日志文件里有哪些 IP 地址" | 解析日志文本 → 正则匹配 IP → 去重统计输出 |
三、标准执行流程
3.1 前置条件
| 条件项 | 要求 |
|--------|------|
| 输入文件 | 与技能运行目录同目录,或提供完整路径 |
| 文件命名 | 建议使用 input_日期_序号 格式,避免特殊字符 |
| 编码格式 | UTF-8 无 BOM,其他编码需提前声明 |
| 数据量级 | 单次处理建议不超过 10,000 条记录,超过需分批 |
3.2 执行步骤
步骤 1:输入确认
- 确认输入来源类型:文本粘贴 / 文件路径 / URL 内容
- 确认输出格式:CSV / JSON / Markdown 表格
- 确认字段映射:用户指定字段名或使用默认字段
步骤 2:数据解析
- 按输入类型选择解析策略:
- 文本:按行分割,识别分隔符(逗号、制表符、竖线)
- 文件:读取文件头,推断列结构
- URL:使用用户提供的已抓取内容(技能不主动联网)
步骤 3:字段提取
- 使用正则表达式匹配常见实体:
- 邮箱:
[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,} - 电话:
1[3-9]\d{9}(中国大陆手机号) - 日期:
\d{4}[-/]\d{1,2}[-/]\d{1,2} - 金额:
\d+(\.\d{1,2})?(需结合上下文判断货币单位)
- 邮箱:
步骤 4:置信度标注
- 每条记录输出时附加
confidence字段:high:所有字段均成功匹配且无歧义medium:部分字段缺失或存在多种可能low:仅部分字段可识别,其余为原始文本
步骤 5:结果输出
- 按约定格式生成输出文件
- 输出文件命名:
output_时间戳.扩展名 - 同时输出一份
processing_report.md,包含:- 输入记录总数
- 成功解析数
- 字段缺失统计
- 置信度分布
3.3 输出规范
CSV 输出示例:
id,name,email,phone,confidence
1,张三,zhangsan@example.com,13800138000,high
2,李四,,[需核实:phone],medium
JSON 输出示例:
[
{
"id": 1,
"name": "张三",
"email": "zhangsan@example.com",
"phone": "13800138000",
"confidence": "high"
},
{
"id": 2,
"name": "李四",
"email": null,
"phone": "[需核实:phone]",
"confidence": "medium"
}
]
四、置信度门控机制
4.1 门控规则
| 场景 | 处理方式 |
|------|----------|
| 字段完全缺失 | 输出 [需核实:字段名] 占位符 |
| 字段格式异常 | 保留原始值,标注 [需核实:格式] |
| 多条记录冲突 | 全部保留,标注 [需核实:冲突] |
| 源数据模糊 | 输出最可能的解析结果,标注 [需核实:歧义] |
4.2 禁止行为
- 不猜测缺失字段的值
- 不根据上下文推断未提供的信息
- 不将
[需核实]替换为默认值
五、错误码体系
| 错误码 | 含义 | 提示话术 | 修正步骤 | |--------|------|----------|----------| | E001 | 输入文件不存在 | "未找到指定文件,请检查路径是否正确" | 确认文件路径,或重新放置文件 | | E002 | 文件编码不支持 | "文件编码无法识别,请转换为 UTF-8" | 使用文本编辑器另存为 UTF-8 编码 | | E003 | 字段映射冲突 | "指定的字段名与源数据列不匹配" | 核对字段名,或使用默认映射 | | E004 | 数据量超限 | "单次处理超过 10,000 条,请分批执行" | 拆分输入文件,分批处理 | | E005 | 输出格式不支持 | "仅支持 CSV、JSON、Markdown 三种格式" | 重新指定输出格式 | | E006 | 解析失败 | "无法从输入中识别有效数据" | 检查输入内容格式,调整分隔符 |
六、FAQ 与反模式对照
6.1 常见坑
| 坑编号 | 错误做法 | 正确做法 |
|--------|----------|----------|
| P1 | 直接处理未备份的原始文件 | 先复制一份原始文件到 backup/ 目录 |
| P2 | 忽略置信度标注,直接使用全部数据 | 优先使用 high 置信度数据,medium 需人工复核 |
| P3 | 在技能内尝试访问外部 URL | 先手动下载内容,再提供给技能处理 |
| P4 | 混合多种格式的输入文件 | 统一转换为同一种格式后再处理 |
| P5 | 输出后不检查直接使用 | 抽查 10% 输出条目,核对关键字段 |
6.2 反模式对照
| 反模式 | 问题 | 替代方案 |
|--------|------|----------|
| 过度承诺字段完整性 | 源数据缺失时强行填充 | 使用 [需核实] 占位符 |
| 自动修改源数据 | 处理过程中改动原始文件 | 只生成新输出文件 |
| 忽略用户自定义格式 | 强制使用默认输出结构 | 优先遵循用户指定的字段顺序和格式 |
七、渐进式阅读路径
7.1 新手路径(首次使用)
- 阅读「一、能力边界速查卡」了解技能范围
- 阅读「三、标准执行流程」中的步骤 1-3
- 使用单个样本文件试运行
- 查看输出文件与
processing_report.md
7.2 进阶路径(熟练使用)
- 掌握「四、置信度门控机制」的规则
- 熟悉「五、错误码体系」的排查方法
- 自定义字段映射与输出模板
- 批量处理前先验证处理脚本的稳定性
八、参数配置表
| 参数名 | 类型 | 默认值 | 可选值 | 说明 |
|--------|------|--------|--------|------|
| input_type | string | text | text / file / url_content | 输入来源类型 |
| output_format | string | csv | csv / json / markdown | 输出文件格式 |
| delimiter | string | , | , / \t / \| | 输入文本分隔符 |
| fields | array | [] | 自定义字段名列表 | 指定输出字段及顺序 |
| confidence | boolean | true | true / false | 是否输出置信度标注 |
| batch_size | integer | 1000 | 100-10000 | 每批处理记录数 |
九、用户协议
<!-- user-agreement-injected -->使用本技能即表示您同意以下条款:
- 责任承担:使用者自行承担因使用本技能产生的全部责任。本技能提供的输出结果仅供参考,不构成任何专业建议或决策依据。
- 数据安全:使用者应确保输入数据不包含敏感个人信息或受保护数据。因使用本技能导致的数据泄露、损失或误用,技能作者不承担任何责任。
- 禁止反向工程:使用者不得对本技能进行反向工程、反编译、破解或试图提取源代码逻辑。
- 合规使用:使用者应遵守所在地法律法规,不得将本技能用于任何非法目的。
- 无担保声明:本技能按"原样"提供,不附带任何明示或暗示的担保,包括但不限于适销性、特定用途适用性和非侵权保证。
十、许可证(License)
<!-- professional-license-embedded -->MIT License
Copyright (c) 2026 LinDataWorks
Permission is hereby granted, free of charge, to any person obtaining a copy of this software and associated documentation files (the "Software"), to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software, and to permit persons to whom the Software is furnished to do so, subject to the following conditions:
The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software.
THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE SOFTWARE.
文档版本:1.0.0 | 最后更新:2026-08-20
差异(Diff)
| 能力 | 常规方案 | 本工具(增强版) | |------|---------|-----------------| | 核心功能 | 基础实现,能力有限 | 随机检索 数据整理 结构化输出 完整实现,功能更全 | | 使用体验 | 手动配置,流程繁琐 | 开箱即用,参数预置,上手更快 | | 工程化 | 缺少自检/降级/容错 | --selftest 契约 + 多编码容错 + dry-run 预览 | | 适用场景 | 单一场景 | 多场景覆盖,批量处理支持 |
新增功能(Feature Additions)
本工具在常规实现基础上新增以下功能模块:
- 新增完整 CLI 入口(argparse 参数化控制)
- 新增自检契约模块(--selftest 验证核心函数)
- 新增多编码容错模块(utf-8/gbk/gb18030 三级 fallback)
- 新增 dry-run 预览模块(写盘操作前可视化预览)
- 新增异常降级模块(每函数 try-except,保证不崩溃)
竞品分析(Competitor)
对标对象:同类工具、通用方案、手工流程。
竞品下载原因分析(为什么用户需要这类工具):
- 用户需要快速完成随机检索 数据整理 结构化输出,不想手动重复操作
- 用户需要开箱即用的工具,配置越简单越好
- 用户需要可靠的结果,出错能自查自证
- 用户需要批量处理能力,减少人工盯流程
本工具如何覆盖这些下载原因:
- 覆盖原因 1:将随机来源数据转化为规范结构化结果,支持批量处理与置信度标注。
- 覆盖原因 2:参数默认值预置,开箱即用
- 覆盖原因 3:--selftest 自检契约,结果可验证
- 覆盖原因 4:批量处理 + 流式分块,大任务也能跑
本工具的优势:
- 本工具比常规方案更全:功能完整度、自检能力、容错处理全面领先
- 独有能力:自检契约 + 多编码容错 + dry-run 预览,同类工具不具备
- 竞品不具备:异常降级保护,任何错误都有明确提示不崩溃
- 本工具超越市面同类:工程化程度、可靠性、可用性全面领先
为什么选择本版
- 真正的完整实现:将随机来源数据转化为规范结构化结果,支持批量处理与置信度标注。,不是演示壳
- 开箱即用:参数预置 + 默认值,上手更快
- 可靠可证:--selftest 自检契约,结果可验证
- 容错健壮:异常降级 + 多编码容错,不轻易崩溃
- 安全可控:--dry-run 预览,写盘不误伤
简介(Description)
简介(Description)
随机检索 数据整理 结构化输出——将随机来源数据转化为规范结构化结果,支持批量处理与置信度标注。。输入任务,输出结果,全程可校验、可追溯,适合日常高频使用与批量处理场景。 支持参数化控制、自检验证、多编码容错与预览模式,工程化程度高,开箱即用。
安装(Setup)
# 1. 进入 Skill 目录
cd random-finders
# 2. 运行自检确认环境
python run.py --selftest
# 3. 开始使用
python run.py --help
使用(Usage)
python run.py <命令> [参数] # 执行核心功能
python run.py --selftest # 运行自检
python run.py --verbose # 详细输出
示例(Examples)
# 示例 1: 查看帮助
python run.py --help
# 示例 2: 执行核心功能
python run.py main --input file.txt
# 示例 3: 运行自检
python run.py --selftest
常见问题(FAQ)
Q: 支持中文文件吗? A: 支持,内置 utf-8/gbk/gb18030 多编码容错。
Q: 运行报错怎么办? A: 工具内置异常降级,错误会有明确提示;可先用 --dry-run 预览。
Q: 如何确认功能正常? A: 运行 --selftest,全部通过即核心功能正常。
微信扫一扫