Dataset Lifecycle Retrospective Skill
1. 使用目标
本 Skill 用于把一个专业数据集建设项目,从原始资料处理到最终版本交付的完整过程,整理为可复用、可验证、可迁移的复盘与标准作业流程。
重点不是只写“项目总结”,而是把以下闭环固化下来:
- 原始资料工程:PDF、图片、Word、PPT、网页、表格等资料拆分与归档;
- 精准解析:将复杂资料解析为 Markdown、JSON、表格或结构化片段;
- 知识结构化:生成章节块、证据块、概念块、QA seed、样本 seed;
- 数据集方案设计:明确任务类型、样本类型、split、评测集、安全边界与证据链;
- 方案优化:根据资料质量、训练目标、评测目标与专家审查要求修订方案;
- 初稿生成:按优化方案生成训练集、评测集、RAG/Agent/安全/压力测试样本;
- 多专家评审:组织领域专家、数据科学专家、大模型应用专家等进行 Preview Review;
- 逐条修订:定位专家意见对应样本,执行直接修订、隔离、回源复核或安全加固;
- 对照验证:生成 before/after、revision log、验证报告、发布说明;
- 复盘沉淀:总结得分点、不足、后续治理计划,并产出标准化交付物。
2. 触发场景
当用户出现以下意图时,应优先使用本 Skill:
- “把上面的复盘内容改成标准化的 skill / SOP / 模板”;
- “复盘某个微调数据集/评测集/RAG 数据集建设项目”;
- “总结从资料解析到数据集交付的完整流程”;
- “专家评审意见已经修改,生成复盘报告/交付说明”;
- “把这次数据治理过程沉淀为可复用方法”;
- “给后续类似项目做质量门禁和交付清单”。
不适用:
- 只要求简单润色一段总结;
- 只要求单点数据清洗或 Excel 统计;
- 没有数据集建设、专家评审、版本交付或流程复盘需求的普通文档总结。
3. 输入要求
执行前尽量收集或确认以下材料。若缺失,不要臆造,应在复盘中标注“未提供/待补充”。
3.1 项目背景
- 数据集名称、领域、版本号;
- 建设目标:微调、RAG、Agent、评测、安全评估、压力测试等;
- 使用对象:训练团队、评审专家、业务部门、发布审批人等。
3.2 原始资料与解析产物
- 原始资料类型:PDF、图片、Word、PPT、网页、表格等;
- 拆分策略:按页、章节、图片、表格、附件、主题等;
- 解析产物:Markdown、JSON、CSV/XLSX、图片 OCR、表格抽取结果;
- 解析质量问题:OCR 噪声、公式错误、图表缺失、目录/编委会等非正文污染。
3.3 数据集产物
all.jsonl、split 文件:train/dev/test/holdout;- 评测文件:
rag_eval.jsonl、agent_eval.jsonl、safety_eval.jsonl、stress_eval.jsonl; - seed 文件:
seed_dataset.jsonl或其他 seed/候选池; - schema、字段说明、样本 ID 规则、证据字段。
3.4 专家评审材料
- 专家名单或角色;
- 专家意见清单:CSV、JSONL、Excel、Markdown 均可;
- 优先级:P0/P1/P2 或 blocker/major/minor;
- 每条意见对应的样本 ID、问题描述、建议动作。
3.5 修订与验证产物
- 修订后版本目录;
revision-log.csv/jsonl;before-after.xlsx;revision-verification.json;implementation-report.md;version-notes.md。
4. 标准工作流
Step 1:界定复盘范围
必须先明确复盘覆盖的是完整生命周期,而不是只覆盖最后的专家修订阶段。
推荐表达:
本复盘覆盖从原始资料工程到版本交付验证的完整链路,包括资料拆分、精准解析、知识结构化、方案设计与优化、初稿生成、专家评审、逐条修订、自动验证和版本说明。
Step 2:重建端到端链路
按以下七段组织:
- 资料工程;
- 知识结构化;
- 数据集方案设计;
- 方案优化;
- 数据生成;
- 专家评审;
- 修订验证与发布准备。
每段至少说明:
- 输入是什么;
- 做了什么处理;
- 输出了什么;
- 存在哪些质量风险;
- 是否有可验证产物。
Step 3:整理关键产物清单
按类别列出:
- 原始资料目录;
- 解析中间产物;
- 数据集版本目录;
- split 与评测文件;
- 专家评审清单;
- 修订日志;
- before/after 对照;
- 自动验证报告;
- 最终复盘报告。
Step 4:汇总专家评审与修订结果
需要给出定量统计:
- 专家意见总数;
- 成功定位数;
- 按优先级分布;
- 直接修订数;
- 隔离/回源复核数;
- 未处理或延期项;
- revision log 行数;
- before/after 对照行数。
处理分类建议:
fixed:已可靠修订;quarantined:隔离,避免污染训练/评测;needs_source_review:需回源复核;deferred:因范围或证据不足延期;not_applicable:专家意见不适用或样本已变更。
Step 5:建立质量门禁
至少包含以下检查:
- JSONL 全部可解析;
- 训练样本 schema 完整;
- seed schema 与训练样本 schema 分开校验;
- revision log 不被误当作样本文件;
- 专家点名样本均有处理结果;
- P0 问题全部 fixed/quarantined/needs_source_review;
- 高风险样本有安全边界;
- before/after 对照存在;
- 报告与版本说明存在;
- 无内部占位符、历史摘要占位文本或模板残留。
占位符扫描建议关键词:
[Full tool-call argument omitted from model history][Full file content omitted from model history][Full tool output omitted from model history]TODO待补充占位
注意:TODO、待补充 并非一定错误,但出现在正式交付物中必须人工确认。
Step 6:输出复盘判断
复盘结论应区分两个层次:
- 已完成:专家点名问题的可追溯修订闭环;
- 未必完成:全数据集质量治理闭环。
推荐表述:
当前版本已经完成专家点名问题的可追溯修订闭环,可以作为 vX-draft 进入下一轮评审或发布准备;但尚不能直接等同于全数据集质量治理完成。后续仍需推进规则候选池全量治理、回源复核和正式发布门禁。
Step 7:沉淀后续行动
后续建议至少包括:
- 规则候选池全量治理;
- 回源复核;
- OCR/公式/图表解析质量门禁;
- 训练集与评测集差异化准入标准;
- 安全样本边界强化;
- vX 正式发布冻结检查清单;
- 可复用 SOP 与脚本沉淀。
5. 推荐交付物结构
5.1 Markdown 复盘报告
文件名建议:
dataset-lifecycle-retrospective.md<project>-complete-retrospective.md
推荐章节:
# <项目名称>完整复盘
## 一、复盘范围与结论
## 二、完整流程链路
## 三、关键产物与路径
## 四、专家评审与修订执行情况
## 五、验证结果
## 六、已发现问题与纠偏
## 七、经验得分点
## 八、遗留不足
## 九、下一步建议
## 十、发布/进入下一阶段判断
5.2 Word 复盘报告
当用户要求正式交付、汇报或归档时,应生成 .docx。建议文件名:
<project>-complete-retrospective.docx
Word 内容应包含:
- 标题、版本、日期;
- 流程链路条目;
- 关键产物表;
- 专家修订统计表;
- 问题纠偏表;
- 下一步清单。
5.3 修订对照工作簿
建议文件名:
expert-revision-before-after.xlsx
建议 Sheet:
summary;before_after_<n>;verification_checks;open_items。
5.4 验证报告
建议文件名:
revision-verification.jsonverification-summary.md
必须包含:
- 总体状态:PASS/WARN/FAIL;
- 检查项;
- 检查结果;
- 失败原因;
- 可复现的文件路径或样本 ID。
6. 复盘报告模板
可直接套用以下叙述结构。
6.1 开头结论模板
本复盘覆盖从原始资料工程到 <version> 修订验证的完整链路,而非仅覆盖专家评审后的样本修改阶段。项目已经完成“专家点名问题的可追溯修订闭环”,但尚未完成“全数据集质量治理闭环”。
核心结论:<领域> 专业知识已从 PDF、图片、文档等非结构化资料,经过拆分、精准解析、结构化转换、方案设计、初稿生成、专家评审、逐条修订和自动验证,形成了可继续迭代发布的数据集资产。
6.2 完整流程模板
1. 资料工程:对 <资料类型> 进行拆分,形成可独立解析和追踪的资料单元。
2. 精准解析:将复杂资料解析为 <Markdown/JSON/表格>,并抽取章节块、证据块和结构化 seed。
3. 方案设计:基于解析结果制定 <数据集名称> 构建方案,明确样本类型、split、证据链和安全边界。
4. 方案优化:根据资料质量、训练目标、评测目标与专家可审查性,对构建方案进行迭代优化。
5. 初稿生成:按优化方案处理资料并生成数据集初稿。
6. 专家评审:安排 <专家角色> 对数据集初稿进行 Preview Review,形成优先修订清单。
7. 逐条修订:对专家意见逐项定位、修改、隔离或回源复核,并生成 <version>、对照文件与验证报告。
6.3 最终判断模板
综合判断:<version> 已达到“专家点名问题修订闭环”的要求,可以作为 draft 版本进入下一轮评审/发布准备;但不应直接视为正式发布版本。正式发布前仍需完成规则候选池全量治理、回源复核、解析质量门禁和全量样本抽检。
7. 执行注意事项
- 不要只复盘最后的专家修改阶段;必须覆盖资料拆分、解析、方案、初稿、评审、修订、验证全链路。
- 不要把搜索摘要、文件名或目录列表当作已读取原文;只有实际读取文件或用户提供正文后才能声称“已读”。
- 不要把不可判定样本硬改为看似正确;应标记隔离或回源复核。
- 不要覆盖旧版本;建议新建
vX-draft或vX-final-candidate。 - 校验脚本要区分训练样本、评测样本、seed、revision log、验证报告的不同 schema。
- 复盘结论要区分“专家点名闭环完成”和“全量质量治理完成”。
- 交付正式文档前必须扫描内部占位符和模板残留。
- 如果用户要求可下载交付,应在当前会话 output 目录生成
.md、.docx或.xlsx,并做存在性校验。
8. 最小质量门禁清单
正式答复前自检:
- [ ] 是否覆盖完整生命周期,而不是只写专家修订阶段?
- [ ] 是否列出关键输入、输出、路径或文件?
- [ ] 是否有专家意见处理统计?
- [ ] 是否有 fixed/quarantined/needs_source_review 等处理分类?
- [ ] 是否区分 draft 与 final?
- [ ] 是否明确已完成与未完成边界?
- [ ] 是否给出下一步治理动作?
- [ ] 如生成文件,是否已验证文件存在且内容关键字段齐全?
9. 命名建议
项目级产物推荐命名:
<project>-complete-retrospective.md<project>-complete-retrospective.docx<project>-revision-verification.json<project>-before-after.xlsx<project>-release-gate-checklist.md
Skill 内不要固化某一次项目路径,除非用户明确要求复用该项目目录。默认以模板方式指导后续项目。
微信扫一扫