TRACE Skill 上架前评测
按 SkillHub TRACE 评测体系 对目标 Skill 做静态审计 + 可选运行时抽检,产出上架决策与优化 backlog。
命名澄清:本 skill 的 TRACE = T/R/A/C/E 质量框架,不是 OpenTelemetry / Jaeger 链路 trace。
调用方式:
disable-model-invocation: true,须用户@trace-skill-evaluator或等价显式点名加载,不会从泛对话自动触发。
何时使用
| 用户意图 | 动作 |
|----------|------|
| 上架 SkillHub 前门禁 | 完整 TRACE 评测 + 阻断项检查 + lint-skill-package.mjs |
| 已有 skill 改版后回归 | 读上次报告,填「改版回归 diff」节(见 report-template) |
| 仅关心安全能否过审 | 只跑 T(Trust) + references/security-checklist.md |
| 仅关心 Agent 能否稳定触发 | 重点 A + C,辅以 description 覆盖率 |
不替代:平台科恩/玄武自动化安全扫描的最终结论。
输入
向用户确认或从上下文推断:
- Skill 根目录(含
SKILL.md的文件夹) - 目标平台:SkillHub 公网 / 内网渠道 / 仅团队自用(影响 T 的「国内可用」权重)
- 评测深度:
quick:只读SKILL.md+description+ 目录清单 + quick-checklist(默认)standard:+ 脚本/引用抽样 + lint + 触发探测 + E3 轻量对照full:+ 业务任务 no-skill 双跑对照(见 rubric E3)
执行流程
Step 0:收集物料
读取并列出:
SKILL.md(frontmatter:name、description、disable-model-invocation等)- 同级
references/、scripts/、templates/及 SKILL 内链接到的文件 - 包级配置(
package.json等,若有)
建立文件清单表(路径、用途、是否被 SKILL 显式引用)。
机械门禁(推荐,不替代人工 TRACE):
node scripts/lint-skill-package.mjs <目标-skill-根目录>
评测本 skill 自身时,工作目录为 trace-skill-evaluator/ 根目录执行上述命令。
Step 1:T — Trust(红线优先)
按 security-checklist.md 逐项检查(勿自动 fetch 外链)。
阻断规则:任一项命中「红线」→ 总体结论 不可上架,其余维度仅作参考;优化方案须先消红线。
Step 2:R / A / C / E 子项打分
quick深度:先填 quick-checklist.md 15 项 Y/N- 加载 rubric.md,对每个子项:
- 记录证据(文件路径 + 原文摘录或试跑结果)
- 打分 0–5
- 若 < 3,写入优化项(含建议改法,可落到具体文件)
维度分 = 该维 3 个子项的算术平均(保留 1 位小数)。
Step 3:运行时验证(standard / full)
| 验证类型 | 深度 | 做法 | 维度 |
|----------|------|------|------|
| lint | standard+ | node scripts/lint-skill-package.mjs <dir> | R、C |
| 触发探测 | standard+ | 3 条 prompt:应触发 / 不应触发 / 易混淆 | A |
| 脚本试跑 | standard+ | 目标 skill 的 scripts/ dry-run 或 --help | R、T |
| 轻量对照 | standard+ | 同任务对比有/无本 skill 的报告是否满足 rubric E3 三 checklist | E |
| 业务双跑 | full | 同一业务任务 no-skill vs with-skill,比步数与交付质量 | E |
无法实跑时标注 「未验证」;未做任一对照时 E3 最高 3 分。
Step 4:生成报告与优化方案
严格按 report-template.md 输出;格式参考 example-report.md。
改版回归:若存在上次报告,必须填写模板中「改版回归 diff」表。
优化方案排序:
- P0 — T 红线 / 会导致上架驳回或安全事故
- P1 — 任一分项 < 3 或维度分 < 3.5
- P2 — 3~4 分,改动能明显提升执行成功率或过审率
- P3 — polish,可上架后迭代
每条优化项格式:
- [P?] {维度}-{子项缩写} | 现状 | 建议 | 预期提升 | 涉及文件
Step 5:上架结论
| 条件 | 结论 | |------|------| | T 红线 | ❌ 不可上架 | | 任一分项 < 2 | ❌ 不可上架 | | 维度均 ≥ 3 且综合 ≥ 3.5 | ⚠️ 有条件上架(列出 P1) | | 全维 ≥ 3.5 且 T ≥ 4 | ✅ 建议上架 | | 全维 ≥ 4 且 E ≥ 4 | ✅ 优质,可冲精选 |
综合分 = 五维加权:T 30% + E 25% + A 20% + R 15% + C 10%(T/E 加重,与上架决策一致)。
交付物
TRACE评测报告-{skill-name}-{YYYY-MM-DD}.md(默认写在 skill 根目录或用户指定路径)- 优化 backlog(报告内「优化方案」章节;改版时含 diff 表)
- 口头摘要:综合分、是否可上架、Top 3 必改项
参考
| 文档 | 内容 | |------|------| | references/rubric.md | 5 维 15 子项评分标准 | | references/quick-checklist.md | quick 深度 Y/N 清单 | | references/security-checklist.md | T 维安全与合规 | | references/report-template.md | 报告与回归 diff 模板 | | references/example-report.md | 节选示例报告 | | scripts/lint-skill-package.mjs | 机械门禁脚本 | | SkillHub TRACE 教程 | 平台官方说明 | | TRACE 评测体系详解 | 维度解读 |
Scan to join WeChat group