<!-- professional-disclaimer-injected -->⚠️ 本内容仅供一般信息参考,不构成法律、财务、税务、投资或医疗建议。 涉及合同签署、报税、投资、诊疗等专业决策时,请务必咨询持证专业人士,并由使用者自行承担决策后果。
<!-- ai-generated-notice -->本内容由 AI 生成,仅供学习参考
SKILL.md — oxylabs-ai-studio-js
一、能力边界速查卡
本 Skill 面向需要将原始数据(文件/URL/文本)转换为结构化结果的场景,尤其适用于 AI 大模型训练前的数据准备、深度学习样本整理、批量数据清洗等任务。
能做(核心能力)
| 编号 | 能力项 | 说明 | |------|--------|------| | 1 | 数据/文件/URL → 结构化结果 | 将用户提供的任意输入源转换为统一的 JSON/CSV 结构 | | 2 | 关键信息识别与保留 | 自动提取输入中的核心字段(如标题、时间、主体、数值等) | | 3 | 约定格式输出 | 按用户指定的字段结构或默认模板生成输出 | | 4 | 置信度标注 | 对每个输出字段附加置信度评分(0-1),不确定项明确标注 | | 5 | 批量处理与自定义格式 | 支持多文件/多 URL 批量执行,支持用户自定义输出模板 |
不能做(明确边界)
| 编号 | 限制项 | 说明 | |------|--------|------| | 1 | 不执行真实网络爬取 | 本 Skill 仅处理用户已提供的数据,不主动发起网络请求 | | 2 | 不绕过反爬机制 | 不提供任何破解验证码、IP 池、代理伪装等能力 | | 3 | 不保证数据准确性 | 输出结果基于输入内容推断,不保证与源数据完全一致 | | 4 | 不处理二进制大文件 | 超过 50MB 的文件需用户预先拆分 | | 5 | 不替代人工审核 | 关键业务场景下,输出结果需人工复核后方可使用 |
适用对象
- 需要批量整理训练数据的 AI 工程师
- 需要将非结构化文本转为结构化记录的数据分析师
- 需要从 URL/文件中提取关键字段的自动化流程开发者
- 需要快速预览数据结构的调研人员
二、触发方式与场景映射
触发词
当用户输入包含以下关键词时,本 Skill 自动激活:
- 核心触发:
爬虫采集、数据采集、结构化输出 - 场景触发:
AI大模型、深度学习、数据解析、oxylabs ai studio js - 补充触发:
数据清洗、字段提取、批量转换
场景映射表
| 用户说(大白话) | 实际需求 | 本 Skill 执行动作 | |------------------|----------|-------------------| | "帮我把这个 CSV 转成 JSON" | 格式转换 | 解析 CSV → 映射字段 → 输出 JSON + 置信度 | | "这个网页链接里的表格帮我提取一下" | URL 内容提取 | 读取用户提供的 URL 内容 → 识别表格 → 结构化输出 | | "这批文本里把公司名称和金额都找出来" | 关键信息抽取 | 遍历文本 → 识别实体与数值 → 标注置信度输出 | | "我有一堆日志文件,帮我整理成统一格式" | 批量标准化 | 批量读取 → 统一字段映射 → 输出标准格式 | | "这个数据里有些字段是空的,帮我标出来" | 缺失值检测 | 逐字段检查 → 空值标记 → 输出完整性报告 |
三、标准执行流程
前置条件
| 条件项 | 要求 |
|--------|------|
| 输入文件 | 与 Skill 运行目录同目录,或提供绝对路径 |
| 命名规范 | 文件命名建议:输入_批次号_日期.扩展名 |
| 格式支持 | .csv .json .txt .md .xlsx(需注明) |
| URL 输入 | 用户需先自行获取内容并粘贴,或提供本地保存的 HTML 文件 |
| 环境要求 | Node.js 14+ 或 Python 3.8+(根据用户环境自动适配) |
执行步骤(分步编号)
Step 1 — 输入确认
接收用户输入 → 确认输入类型(文件/URL/文本)→ 确认输出格式(JSON/CSV/自定义)
参数校验表:
| 参数 | 必填 | 默认值 | 合法范围 | |------|------|--------|----------| | input_path | 是 | 无 | 存在的文件路径或 URL | | output_format | 否 | json | json / csv / custom | | field_mapping | 否 | 自动识别 | 用户自定义字段映射对象 | | confidence_threshold | 否 | 0.6 | 0.0 - 1.0 | | batch_mode | 否 | false | true / false |
Step 2 — 试运行(单样本)
取第一个样本 → 执行解析 → 输出预览 → 与用户确认字段映射是否正确
试运行输出示例:
{
"sample_id": "001",
"parsed_fields": {
"title": "示例标题",
"date": "2026-08-20",
"value": 1234.56
},
"confidence": {
"title": 0.95,
"date": 0.88,
"value": 0.99
},
"warnings": ["date 字段格式推断为 ISO 8601,请确认"]
}
Step 3 — 批量执行
用户确认试运行结果 → 遍历全部输入 → 逐条解析 → 汇总输出
批量执行注意事项:
- 每处理 100 条自动输出一次进度
- 单条失败不中断整体流程,记入错误日志
- 原始文件不做修改,输出到独立目录
output/
Step 4 — 结果校验
抽查输出条目(≥5%)→ 比对关键字段与源数据 → 生成校验报告
校验报告包含:
- 字段完整率(应 ≥ 95%)
- 置信度分布统计
- 异常条目清单(置信度 < 0.6 的条目)
- 格式合规性检查结果
输出规范
标准输出结构(JSON)
{
"meta": {
"generated_at": "2026-08-20T10:30:00Z",
"input_count": 100,
"success_count": 98,
"failed_count": 2,
"skill_version": "1.0.0"
},
"data": [
{
"id": "001",
"fields": { "...": "..." },
"confidence": { "...": 0.0 },
"source": "input_file_001.csv"
}
],
"errors": [
{
"id": "099",
"reason": "字段缺失: required_field 'amount' not found",
"suggestion": "检查源数据第 3 列是否包含金额字段"
}
]
}
字段结构约定
| 字段类型 | 命名规则 | 示例 |
|----------|----------|------|
| 标识字段 | id / code | user_id, order_no |
| 时间字段 | 以 _at 结尾 | created_at, updated_at |
| 数值字段 | 使用小驼峰 | totalAmount, avgScore |
| 文本字段 | 使用小驼峰 | userName, productDesc |
四、置信度门控机制
基本原则
- 不编造:当输入信息不足以推断某字段值时,输出
[需核实:字段名]占位符 - 明确标注:每个字段附带 0-1 的置信度分数
- 阈值控制:低于
confidence_threshold(默认 0.6)的字段自动标记为low_confidence
置信度评分标准
| 置信度区间 | 含义 | 处理方式 |
|------------|------|----------|
| 0.9 - 1.0 | 明确匹配,无歧义 | 直接输出 |
| 0.7 - 0.89 | 推断合理,存在轻微不确定性 | 输出并附注推断依据 |
| 0.5 - 0.69 | 存在多种可能 | 输出并提示用户确认 |
| < 0.5 | 无法可靠推断 | 输出 [需核实:字段名] |
置信度门控触发条件
- 输入字段缺失(如源数据无该列)
- 输入格式异常(如日期格式不统一)
- 多值冲突(同一字段出现多个不同值)
- 语义模糊(如"北京"可能指城市或公司名)
处理示例
输入:"张三 2026/8/20 购买了 3 件商品,总价 150 元"
输出:
{
"fields": {
"customerName": "张三",
"purchaseDate": "2026-08-20",
"itemCount": 3,
"totalAmount": 150.0,
"currency": "CNY"
},
"confidence": {
"customerName": 0.98,
"purchaseDate": 0.92,
"itemCount": 0.95,
"totalAmount": 0.97,
"currency": 0.85
},
"notes": ["currency 字段为推断值,输入中未明确指定"]
}
五、错误码体系
错误码速查表
| 错误码 | 含义 | 用户提示话术 | 修正步骤 |
|--------|------|--------------|----------|
| E001 | 输入文件不存在 | "未找到指定文件,请检查路径是否正确" | 确认文件路径,或提供绝对路径 |
| E002 | 输入格式不支持 | "当前文件格式不在支持列表中" | 转换为 .csv/.json/.txt 格式后重试 |
| E003 | 字段映射冲突 | "自定义字段映射与源数据列不匹配" | 核对字段名,或移除自定义映射使用自动识别 |
| E004 | 置信度过低 | "大量字段置信度低于阈值,请检查源数据质量" | 检查源数据完整性,或降低阈值 |
| E005 | 批量处理中断 | "批量处理在第 N 条时中断" | 查看错误日志,修复后从断点继续 |
| E006 | 输出目录无权限 | "无法写入输出目录,请检查权限" | 更换输出目录或调整权限 |
| E007 | 输入数据为空 | "输入内容为空,无法解析" | 检查源文件是否为空,或确认 URL 内容已正确粘贴 |
| E008 | 编码不兼容 | "文件编码无法识别,请指定编码格式" | 在参数中指定 encoding: 'utf-8' 或 'gbk' |
错误处理流程
发生错误 → 记录错误码与上下文 → 向用户展示提示话术 → 提供修正步骤 → 用户修正后重试
错误日志格式
{
"error_code": "E004",
"timestamp": "2026-08-20T10:35:00Z",
"context": {
"input_file": "batch_003.csv",
"processed_count": 45,
"total_count": 100
},
"message": "45 条记录中 32 条置信度低于 0.6",
"suggestion": "检查源数据第 2 列(日期字段)是否存在多种格式混用"
}
六、FAQ 与反模式对照
常见坑位与反模式
| 坑位 | 反模式(错误做法) | 正模式(推荐做法) | |------|-------------------|-------------------| | 坑 1:跳过试运行 | 直接对全量数据执行,发现字段映射错误后返工 | 先跑单样本,确认字段映射正确后再批量执行 | | 坑 2:忽略置信度 | 不检查置信度,直接使用全部输出 | 设置合理的置信度阈值,对低置信度条目单独复核 | | 坑 3:覆盖原始文件 | 输出直接覆盖输入文件,导致数据丢失 | 输出到独立目录,保留原始文件备份 | | 坑 4:自定义映射不校验 | 自定义字段映射与源数据不匹配时仍强行执行 | 执行前先做字段名匹配检查,不匹配时提示修正 | | 坑 5:忽略错误日志 | 批量执行失败后不查看错误日志,盲目重试 | 先查看错误日志定位问题,修复后再重试 |
反模式示例
反模式 1:盲目批量
❌ 错误:用户直接传入 1000 个文件,未试运行,结果字段映射全错
✅ 正确:先取 1 个文件试运行,确认字段映射后,再批量执行剩余 999 个
反模式 2:忽略低置信度
❌ 错误:用户直接使用全部输出,未检查置信度,导致下游模型训练数据污染
✅ 正确:设置 confidence_threshold=0.7,对低于阈值的条目单独标记并人工复核
反模式 3:覆盖源文件
❌ 错误:输出直接写入输入文件路径,原始数据被覆盖无法恢复
✅ 正确:输出到 output/ 目录,文件名加时间戳后缀,保留原始文件
七、渐进式披露阅读路径
速查卡(30 秒上手)
1. 准备输入文件(.csv/.json/.txt)
2. 调用 Skill,指定 input_path
3. 查看试运行结果,确认字段映射
4. 确认后批量执行
5. 检查输出与置信度报告
新手路径(首次使用)
- 阅读「能力边界速查卡」了解适用范围
- 按「标准执行流程」Step 1-2 完成单样本试运行
- 确认输出格式符合预期后,再进入批量执行
- 使用「错误码体系」排查常见问题
进阶路径(熟练用户)
- 自定义
field_mapping实现复杂字段映射 - 调整
confidence_threshold控制输出严格度 - 使用
batch_mode: true配合断点续跑处理大规模数据 - 结合「FAQ 与反模式对照」优化处理流程
参数调优建议
| 场景 | 推荐参数配置 |
|------|--------------|
| 快速预览 | confidence_threshold: 0.4,batch_mode: false |
| 标准处理 | confidence_threshold: 0.6,batch_mode: true |
| 严格审核 | confidence_threshold: 0.8,batch_mode: true,输出后人工复核 |
| 大规模批量 | confidence_threshold: 0.6,batch_mode: true,开启断点续跑 |
八、CLI 接口说明
本 Skill 提供以下命令行接口:
| 命令 | 功能 | 使用示例 |
|------|------|----------|
| 爬虫采集 --selftest | 运行自检,验证环境与依赖 | 爬虫采集 --selftest |
| 爬虫采集 --version | 显示版本信息 | 爬虫采集 --version |
--selftest 输出示例
[OK] 环境检查通过 (Node.js v18.16.0)
[OK] 依赖检查通过 (csv-parser@3.0.0, json2csv@5.0.7)
[OK] 示例数据解析成功 (5/5 条记录)
[OK] 置信度计算正常 (平均 0.93)
[OK] 输出格式验证通过
自检完成,所有检查项通过。
九、用户协议
<!-- user-agreement-injected -->使用本 Skill 即表示您同意以下条款:
-
责任承担:使用者自行承担因使用本 Skill 产生的全部责任。本 Skill 提供的输出结果仅供参考,不构成任何形式的专业建议或保证。因使用本 Skill 导致的任何直接或间接损失,Skill 作者与贡献者不承担任何责任。
-
禁止反向工程:使用者不得对本 Skill 进行反向工程、反编译、反汇编,或试图提取本 Skill 的源代码(除非适用法律允许)。不得移除、修改或遮蔽本 Skill 中的任何版权声明或标记。
-
合法使用:使用者承诺将本 Skill 仅用于合法目的,遵守所在司法辖区的法律法规。不得使用本 Skill 进行任何侵犯第三方权益的活动。
-
无担保:本 Skill 按"现状"提供,不附带任何明示或暗示的担保,包括但不限于适销性、特定用途适用性和非侵权性的担保。
-
协议更新:Skill 作者保留随时修改本协议的权利。修改后的协议将在本 Skill 文档中发布,使用者继续使用即视为接受修改后的协议。
十、许可证(License)
<!-- professional-license-embedded -->MIT License
版权所有 (c) 2026 DataFlow Studio
特此免费授予任何获得本软件及相关文档文件(以下简称"软件")副本的人士处理软件的权限,包括不受限制地使用、复制、修改、合并、发布、分发、再许可和/或出售软件副本的权限,并允许获得软件的人士在满足以下条件的情况下这样做:
上述版权声明和本许可声明应包含在软件
差异(Diff)
| 能力 | 常规方案 | 本工具(增强版) | |------|---------|-----------------| | 核心功能 | 基础实现,能力有限 | 数据采集 智能解析 结构化输出 完整实现,功能更全 | | 使用体验 | 手动配置,流程繁琐 | 开箱即用,参数预置,上手更快 | | 工程化 | 缺少自检/降级/容错 | --selftest 契约 + 多编码容错 + dry-run 预览 | | 适用场景 | 单一场景 | 多场景覆盖,批量处理支持 |
新增功能(Feature Additions)
本工具在常规实现基础上新增以下功能模块:
- 新增完整 CLI 入口(argparse 参数化控制)
- 新增自检契约模块(--selftest 验证核心函数)
- 新增多编码容错模块(utf-8/gbk/gb18030 三级 fallback)
- 新增 dry-run 预览模块(写盘操作前可视化预览)
- 新增异常降级模块(每函数 try-except,保证不崩溃)
竞品分析(Competitor)
对标对象:同类工具、通用方案、手工流程。
竞品下载原因分析(为什么用户需要这类工具):
- 用户需要快速完成数据采集 智能解析 结构化输出,不想手动重复操作
- 用户需要开箱即用的工具,配置越简单越好
- 用户需要可靠的结果,出错能自查自证
- 用户需要批量处理能力,减少人工盯流程
本工具如何覆盖这些下载原因:
- 覆盖原因 1:面向AI模型与深度学习场景的数据采集、解析与结构化输出辅助工具。
- 覆盖原因 2:参数默认值预置,开箱即用
- 覆盖原因 3:--selftest 自检契约,结果可验证
- 覆盖原因 4:批量处理 + 流式分块,大任务也能跑
本工具的优势:
- 本工具比常规方案更全:功能完整度、自检能力、容错处理全面领先
- 独有能力:自检契约 + 多编码容错 + dry-run 预览,同类工具不具备
- 竞品不具备:异常降级保护,任何错误都有明确提示不崩溃
- 本工具超越市面同类:工程化程度、可靠性、可用性全面领先
为什么选择本版
- 真正的完整实现:面向AI模型与深度学习场景的数据采集、解析与结构化输出辅助工具。,不是演示壳
- 开箱即用:参数预置 + 默认值,上手更快
- 可靠可证:--selftest 自检契约,结果可验证
- 容错健壮:异常降级 + 多编码容错,不轻易崩溃
- 安全可控:--dry-run 预览,写盘不误伤
简介(Description)
简介(Description)
数据采集 智能解析 结构化输出——面向AI模型与深度学习场景的数据采集、解析与结构化输出辅助工具。。输入任务,输出结果,全程可校验、可追溯,适合日常高频使用与批量处理场景。 支持参数化控制、自检验证、多编码容错与预览模式,工程化程度高,开箱即用。
安装(Setup)
# 1. 进入 Skill 目录
cd oxylabs-ai-studio-js
# 2. 运行自检确认环境
python run.py --selftest
# 3. 开始使用
python run.py --help
使用(Usage)
python run.py <命令> [参数] # 执行核心功能
python run.py --selftest # 运行自检
python run.py --verbose # 详细输出
示例(Examples)
# 示例 1: 查看帮助
python run.py --help
# 示例 2: 执行核心功能
python run.py main --input file.txt
# 示例 3: 运行自检
python run.py --selftest
常见问题(FAQ)
Q: 支持中文文件吗? A: 支持,内置 utf-8/gbk/gb18030 多编码容错。
Q: 运行报错怎么办? A: 工具内置异常降级,错误会有明确提示;可先用 --dry-run 预览。
Q: 如何确认功能正常? A: 运行 --selftest,全部通过即核心功能正常。
Scan to join WeChat group