任务偏离评估
概述
对"已经通过某个 skill / 专家 / 专家团完成任务"的执行过程做一次结构化复盘。核心动作是:把被评估对象预设的标准流程与本次会话实际执行的流程逐项对照,量化偏离程度,定位原因,沉淀改进建议,最后产出一份可直接查看的 HTML 报告。
本技能是"事后复盘"技能,不参与任务本身,只评估任务做得是否偏离了标准打法。
适用边界(不适用场景)
- 任务进行中不触发:只在任务完成后复盘,中途调用会打断正常执行。
- 不评估业务对错:只对比"流程是否按预设打法执行",不判断任务产出内容本身的业务正确性(如合同条款解读是否准确)。
- 无标准流程不评估:被评估对象没有成文的流程定义(SKILL.md / 专家说明)时,先补齐定义再评估,否则对比失去基准。
调用示例
- 「用 task-deviation-assessment 复盘一下刚才 contract-compress 的执行过程」→ 读取该 skill 的 SKILL.md 提取标准流程,回顾本次会话实际执行,逐项对比并生成 HTML 报告。
- 「对这个专家的这次任务做个偏离分析」→ 确认专家名称与任务范围后,按七步工作流执行。
前置条件(先确认信息齐备,缺则先补齐)
评估前必须能拿到两类事实,缺一不可:
- 预设标准流程:来自被评估对象自身的定义文件——skill 的
SKILL.md、专家包说明、专家团说明。提炼其中的步骤顺序、关键决策点、必做检查项、产出规范。 - 实际执行流程:来自本次会话的真实执行记录——工具调用、关键决策、实际产出、被跳过或新增的步骤。
信息缺失时:先读被评估对象的定义文件,或从历史会话/记忆中检索;仍缺失就向用户索取,不得臆测补全。
工作流
复盘分七步,按顺序执行:
-
确定评估对象与任务范围
- 明确被评估对象的名称与类型(skill / 专家 / 专家团)。
- 明确任务目标、交付物、范围边界、执行时长与上下文。
- 一句话写清"这次任务本来要达成什么"。
-
提取预设标准流程
- 读取被评估对象的定义文件(
SKILL.md、专家包、专家团说明)。 - 提炼为有序的阶段列表,每个阶段标注预设步骤、关键决策点、预期产出。
- 读取被评估对象的定义文件(
-
提取实际执行流程
- 回顾本次会话的真实执行过程(工具调用、决策、产出、跳过的步骤)。
- 按与第 2 步相同的阶段粒度还原实际步骤,忠实记录,不美化、不补写。
-
逐项对比
- 以阶段为单位,将"预设步骤"与"实际步骤"一一对照。
- 记录每个阶段的预设步骤与实际步骤,作为对比表的数据来源。
-
偏离识别与分级
- 对每个阶段判定偏离程度,按下方分级标准赋值。
- 汇总各级别数量,形成偏离总览。
-
原因分析与改进建议
- 仅对存在偏离的阶段,分析根因(外部约束 / 信息缺失 / 决策失误 / 工具限制等)。
- 每条给出可落地的改进建议,避免空话。
-
生成 HTML 报告
- 按
references/data-schema.md定义的数据模型,将复盘结果整理为一份 JSON。 - 运行
scripts/generate_report.py生成 HTML(禁止手写 HTML、禁止用正则拼 HTML)。 - 生成后向用户提供报告文件路径;在 WorkBuddy 环境下调用 present_files 推送预览。
- 按
偏离分级标准
| 级别 | 中文 | 判据 |
|------|------|------|
| none | 无偏离 | 实际步骤与预设步骤一致,或仅有等价表述差异,结果无影响 |
| minor | 轻微偏离 | 步骤顺序微调、非关键步骤简化或合并,不影响最终结果 |
| significant | 显著偏离 | 跳过/新增了关键步骤,影响效率或质量,但任务最终仍达成 |
| severe | 严重偏离 | 偏离导致错误、返工、交付不完整或目标未达成 |
判定要点:
- 分级看对结果与质量的影响,不看步骤数量差异。
- 同一阶段只取一个最高级别。
- 无偏离的阶段也应进入对比表,保证逐项完整性。
报告生成
报告由本技能目录下的 scripts/generate_report.py 生成,保证表格、卡片、可视化与响应式布局的一致性和正确性。运行脚本时使用脚本的绝对路径(本技能安装目录下的 scripts/generate_report.py),并优先选用已安装 markdown 库的 Python 环境:
python <技能目录>/scripts/generate_report.py <评估数据.json> [输出.html]
- 输入:符合
references/data-schema.md的 JSON 文件。 - 输出:若不传第二个参数,默认在输入 JSON 同目录生成同名
.html。 - 自由文本字段(偏离描述、原因、建议、结论等)支持 Markdown,脚本内部用
markdown库转换(缺失时降级为纯文本渲染并在 stderr 提示),遵循"正规解析库转换、禁止正则拼 HTML"的规范。
运行环境
- Python 3.8+,标准库即可运行。
- 可选依赖:
markdown库(pip install markdown)。未安装时脚本仍可运行,自由文本降级为纯文本渲染(换行保留,Markdown 语法不转换),并在 stderr 提示安装方式。
资源
scripts/generate_report.py—— 报告生成脚本(读取 JSON,渲染响应式 HTML)references/data-schema.md—— 评估数据模型定义与完整示例examples/sample-assessment.json—— 可直接运行的示例评估数据
微信扫一扫