Back to skills
extension
Category: Data & AnalyticsNo API key required

数据集建设全流程复盘

将“资料拆分/精准解析→知识结构化→数据集方案设计与优化→初稿生成→多专家评审→逐条修订验证→复盘报告与版本交付”的完整数据集建设链路标准化。适用于把一次数据集建设、微调数据集治理、RAG/Agent 评测集构建、专家评审修订项目沉淀为可复用复盘、SOP、交付清单和质量门禁。遇到用户要求“复盘数据集建设流程”“把复盘沉淀成规范/skill/SOP”“专家评审后修订闭环”“生成 vX draft 复盘报告”“从资料解析到数据集交付全流程总结”时使用。

personAuthor: user_d0deb03ahubcommunity

Dataset Lifecycle Retrospective Skill

1. 使用目标

本 Skill 用于把一个专业数据集建设项目,从原始资料处理到最终版本交付的完整过程,整理为可复用、可验证、可迁移的复盘与标准作业流程。

重点不是只写“项目总结”,而是把以下闭环固化下来:

  1. 原始资料工程:PDF、图片、Word、PPT、网页、表格等资料拆分与归档;
  2. 精准解析:将复杂资料解析为 Markdown、JSON、表格或结构化片段;
  3. 知识结构化:生成章节块、证据块、概念块、QA seed、样本 seed;
  4. 数据集方案设计:明确任务类型、样本类型、split、评测集、安全边界与证据链;
  5. 方案优化:根据资料质量、训练目标、评测目标与专家审查要求修订方案;
  6. 初稿生成:按优化方案生成训练集、评测集、RAG/Agent/安全/压力测试样本;
  7. 多专家评审:组织领域专家、数据科学专家、大模型应用专家等进行 Preview Review;
  8. 逐条修订:定位专家意见对应样本,执行直接修订、隔离、回源复核或安全加固;
  9. 对照验证:生成 before/after、revision log、验证报告、发布说明;
  10. 复盘沉淀:总结得分点、不足、后续治理计划,并产出标准化交付物。

2. 触发场景

当用户出现以下意图时,应优先使用本 Skill:

  • “把上面的复盘内容改成标准化的 skill / SOP / 模板”;
  • “复盘某个微调数据集/评测集/RAG 数据集建设项目”;
  • “总结从资料解析到数据集交付的完整流程”;
  • “专家评审意见已经修改,生成复盘报告/交付说明”;
  • “把这次数据治理过程沉淀为可复用方法”;
  • “给后续类似项目做质量门禁和交付清单”。

不适用:

  • 只要求简单润色一段总结;
  • 只要求单点数据清洗或 Excel 统计;
  • 没有数据集建设、专家评审、版本交付或流程复盘需求的普通文档总结。

3. 输入要求

执行前尽量收集或确认以下材料。若缺失,不要臆造,应在复盘中标注“未提供/待补充”。

3.1 项目背景

  • 数据集名称、领域、版本号;
  • 建设目标:微调、RAG、Agent、评测、安全评估、压力测试等;
  • 使用对象:训练团队、评审专家、业务部门、发布审批人等。

3.2 原始资料与解析产物

  • 原始资料类型:PDF、图片、Word、PPT、网页、表格等;
  • 拆分策略:按页、章节、图片、表格、附件、主题等;
  • 解析产物:Markdown、JSON、CSV/XLSX、图片 OCR、表格抽取结果;
  • 解析质量问题:OCR 噪声、公式错误、图表缺失、目录/编委会等非正文污染。

3.3 数据集产物

  • all.jsonl、split 文件:train/dev/test/holdout
  • 评测文件:rag_eval.jsonlagent_eval.jsonlsafety_eval.jsonlstress_eval.jsonl
  • seed 文件:seed_dataset.jsonl 或其他 seed/候选池;
  • schema、字段说明、样本 ID 规则、证据字段。

3.4 专家评审材料

  • 专家名单或角色;
  • 专家意见清单:CSV、JSONL、Excel、Markdown 均可;
  • 优先级:P0/P1/P2 或 blocker/major/minor;
  • 每条意见对应的样本 ID、问题描述、建议动作。

3.5 修订与验证产物

  • 修订后版本目录;
  • revision-log.csv/jsonl
  • before-after.xlsx
  • revision-verification.json
  • implementation-report.md
  • version-notes.md

4. 标准工作流

Step 1:界定复盘范围

必须先明确复盘覆盖的是完整生命周期,而不是只覆盖最后的专家修订阶段。

推荐表达:

本复盘覆盖从原始资料工程到版本交付验证的完整链路,包括资料拆分、精准解析、知识结构化、方案设计与优化、初稿生成、专家评审、逐条修订、自动验证和版本说明。

Step 2:重建端到端链路

按以下七段组织:

  1. 资料工程;
  2. 知识结构化;
  3. 数据集方案设计;
  4. 方案优化;
  5. 数据生成;
  6. 专家评审;
  7. 修订验证与发布准备。

每段至少说明:

  • 输入是什么;
  • 做了什么处理;
  • 输出了什么;
  • 存在哪些质量风险;
  • 是否有可验证产物。

Step 3:整理关键产物清单

按类别列出:

  • 原始资料目录;
  • 解析中间产物;
  • 数据集版本目录;
  • split 与评测文件;
  • 专家评审清单;
  • 修订日志;
  • before/after 对照;
  • 自动验证报告;
  • 最终复盘报告。

Step 4:汇总专家评审与修订结果

需要给出定量统计:

  • 专家意见总数;
  • 成功定位数;
  • 按优先级分布;
  • 直接修订数;
  • 隔离/回源复核数;
  • 未处理或延期项;
  • revision log 行数;
  • before/after 对照行数。

处理分类建议:

  • fixed:已可靠修订;
  • quarantined:隔离,避免污染训练/评测;
  • needs_source_review:需回源复核;
  • deferred:因范围或证据不足延期;
  • not_applicable:专家意见不适用或样本已变更。

Step 5:建立质量门禁

至少包含以下检查:

  1. JSONL 全部可解析;
  2. 训练样本 schema 完整;
  3. seed schema 与训练样本 schema 分开校验;
  4. revision log 不被误当作样本文件;
  5. 专家点名样本均有处理结果;
  6. P0 问题全部 fixed/quarantined/needs_source_review;
  7. 高风险样本有安全边界;
  8. before/after 对照存在;
  9. 报告与版本说明存在;
  10. 无内部占位符、历史摘要占位文本或模板残留。

占位符扫描建议关键词:

  • [Full tool-call argument omitted from model history]
  • [Full file content omitted from model history]
  • [Full tool output omitted from model history]
  • TODO
  • 待补充
  • 占位

注意:TODO待补充 并非一定错误,但出现在正式交付物中必须人工确认。

Step 6:输出复盘判断

复盘结论应区分两个层次:

  • 已完成:专家点名问题的可追溯修订闭环;
  • 未必完成:全数据集质量治理闭环。

推荐表述:

当前版本已经完成专家点名问题的可追溯修订闭环,可以作为 vX-draft 进入下一轮评审或发布准备;但尚不能直接等同于全数据集质量治理完成。后续仍需推进规则候选池全量治理、回源复核和正式发布门禁。

Step 7:沉淀后续行动

后续建议至少包括:

  • 规则候选池全量治理;
  • 回源复核;
  • OCR/公式/图表解析质量门禁;
  • 训练集与评测集差异化准入标准;
  • 安全样本边界强化;
  • vX 正式发布冻结检查清单;
  • 可复用 SOP 与脚本沉淀。

5. 推荐交付物结构

5.1 Markdown 复盘报告

文件名建议:

  • dataset-lifecycle-retrospective.md
  • <project>-complete-retrospective.md

推荐章节:

# <项目名称>完整复盘

## 一、复盘范围与结论
## 二、完整流程链路
## 三、关键产物与路径
## 四、专家评审与修订执行情况
## 五、验证结果
## 六、已发现问题与纠偏
## 七、经验得分点
## 八、遗留不足
## 九、下一步建议
## 十、发布/进入下一阶段判断

5.2 Word 复盘报告

当用户要求正式交付、汇报或归档时,应生成 .docx。建议文件名:

  • <project>-complete-retrospective.docx

Word 内容应包含:

  • 标题、版本、日期;
  • 流程链路条目;
  • 关键产物表;
  • 专家修订统计表;
  • 问题纠偏表;
  • 下一步清单。

5.3 修订对照工作簿

建议文件名:

  • expert-revision-before-after.xlsx

建议 Sheet:

  • summary
  • before_after_<n>
  • verification_checks
  • open_items

5.4 验证报告

建议文件名:

  • revision-verification.json
  • verification-summary.md

必须包含:

  • 总体状态:PASS/WARN/FAIL;
  • 检查项;
  • 检查结果;
  • 失败原因;
  • 可复现的文件路径或样本 ID。

6. 复盘报告模板

可直接套用以下叙述结构。

6.1 开头结论模板

本复盘覆盖从原始资料工程到 <version> 修订验证的完整链路,而非仅覆盖专家评审后的样本修改阶段。项目已经完成“专家点名问题的可追溯修订闭环”,但尚未完成“全数据集质量治理闭环”。

核心结论:<领域> 专业知识已从 PDF、图片、文档等非结构化资料,经过拆分、精准解析、结构化转换、方案设计、初稿生成、专家评审、逐条修订和自动验证,形成了可继续迭代发布的数据集资产。

6.2 完整流程模板

1. 资料工程:对 <资料类型> 进行拆分,形成可独立解析和追踪的资料单元。
2. 精准解析:将复杂资料解析为 <Markdown/JSON/表格>,并抽取章节块、证据块和结构化 seed。
3. 方案设计:基于解析结果制定 <数据集名称> 构建方案,明确样本类型、split、证据链和安全边界。
4. 方案优化:根据资料质量、训练目标、评测目标与专家可审查性,对构建方案进行迭代优化。
5. 初稿生成:按优化方案处理资料并生成数据集初稿。
6. 专家评审:安排 <专家角色> 对数据集初稿进行 Preview Review,形成优先修订清单。
7. 逐条修订:对专家意见逐项定位、修改、隔离或回源复核,并生成 <version>、对照文件与验证报告。

6.3 最终判断模板

综合判断:<version> 已达到“专家点名问题修订闭环”的要求,可以作为 draft 版本进入下一轮评审/发布准备;但不应直接视为正式发布版本。正式发布前仍需完成规则候选池全量治理、回源复核、解析质量门禁和全量样本抽检。

7. 执行注意事项

  1. 不要只复盘最后的专家修改阶段;必须覆盖资料拆分、解析、方案、初稿、评审、修订、验证全链路。
  2. 不要把搜索摘要、文件名或目录列表当作已读取原文;只有实际读取文件或用户提供正文后才能声称“已读”。
  3. 不要把不可判定样本硬改为看似正确;应标记隔离或回源复核。
  4. 不要覆盖旧版本;建议新建 vX-draftvX-final-candidate
  5. 校验脚本要区分训练样本、评测样本、seed、revision log、验证报告的不同 schema。
  6. 复盘结论要区分“专家点名闭环完成”和“全量质量治理完成”。
  7. 交付正式文档前必须扫描内部占位符和模板残留。
  8. 如果用户要求可下载交付,应在当前会话 output 目录生成 .md.docx.xlsx,并做存在性校验。

8. 最小质量门禁清单

正式答复前自检:

  • [ ] 是否覆盖完整生命周期,而不是只写专家修订阶段?
  • [ ] 是否列出关键输入、输出、路径或文件?
  • [ ] 是否有专家意见处理统计?
  • [ ] 是否有 fixed/quarantined/needs_source_review 等处理分类?
  • [ ] 是否区分 draft 与 final?
  • [ ] 是否明确已完成与未完成边界?
  • [ ] 是否给出下一步治理动作?
  • [ ] 如生成文件,是否已验证文件存在且内容关键字段齐全?

9. 命名建议

项目级产物推荐命名:

  • <project>-complete-retrospective.md
  • <project>-complete-retrospective.docx
  • <project>-revision-verification.json
  • <project>-before-after.xlsx
  • <project>-release-gate-checklist.md

Skill 内不要固化某一次项目路径,除非用户明确要求复用该项目目录。默认以模板方式指导后续项目。