← 返回 Skill 列表
extension
分类: 数据与分析无需 API Key

SkillHub上架评测

按 SkillHub TRACE 框架(Trust / Reliability / Adaptability / Convention / Effectiveness, 5 维 15 子项)对 Agent Skill 做上架前质量评测,输出五维得分、阻断项与分优先级优化方案。 当用户说「TRACE 评测」「上架前评 skill」「skill 质量打分」「五维度评测」「评一下这个技能包」 「上架 SkillHub 前检查」「出 skill 优化方案」时使用。

person作者: user_0dea6a1dhubcommunity

TRACE Skill 上架前评测

按 SkillHub TRACE 评测体系 对目标 Skill 做静态审计 + 可选运行时抽检,产出上架决策与优化 backlog。

命名澄清:本 skill 的 TRACE = T/R/A/C/E 质量框架,不是 OpenTelemetry / Jaeger 链路 trace。

调用方式:disable-model-invocation: true,须用户 @trace-skill-evaluator 或等价显式点名加载,不会从泛对话自动触发。

何时使用

| 用户意图 | 动作 | |----------|------| | 上架 SkillHub 前门禁 | 完整 TRACE 评测 + 阻断项检查 + lint-skill-package.mjs | | 已有 skill 改版后回归 | 读上次报告,填「改版回归 diff」节(见 report-template) | | 仅关心安全能否过审 | 只跑 T(Trust) + references/security-checklist.md | | 仅关心 Agent 能否稳定触发 | 重点 A + C,辅以 description 覆盖率 |

不替代:平台科恩/玄武自动化安全扫描的最终结论。

输入

向用户确认或从上下文推断:

  1. Skill 根目录(含 SKILL.md 的文件夹)
  2. 目标平台:SkillHub 公网 / 内网渠道 / 仅团队自用(影响 T 的「国内可用」权重)
  3. 评测深度:
    • quick:只读 SKILL.md + description + 目录清单 + quick-checklist(默认)
    • standard:+ 脚本/引用抽样 + lint + 触发探测 + E3 轻量对照
    • full:+ 业务任务 no-skill 双跑对照(见 rubric E3)

执行流程

Step 0:收集物料

读取并列出:

  • SKILL.md(frontmatter:name、description、disable-model-invocation 等)
  • 同级 references/、scripts/、templates/ 及 SKILL 内链接到的文件
  • 包级配置(package.json 等,若有)

建立文件清单表(路径、用途、是否被 SKILL 显式引用)。

机械门禁(推荐,不替代人工 TRACE):

node scripts/lint-skill-package.mjs <目标-skill-根目录>

评测本 skill 自身时,工作目录为 trace-skill-evaluator/ 根目录执行上述命令。

Step 1:T — Trust(红线优先)

按 security-checklist.md 逐项检查(勿自动 fetch 外链)。

阻断规则:任一项命中「红线」→ 总体结论 不可上架,其余维度仅作参考;优化方案须先消红线。

Step 2:R / A / C / E 子项打分

  1. quick 深度:先填 quick-checklist.md 15 项 Y/N
  2. 加载 rubric.md,对每个子项:
    • 记录证据(文件路径 + 原文摘录或试跑结果)
    • 打分 0–5
    • 若 < 3,写入优化项(含建议改法,可落到具体文件)

维度分 = 该维 3 个子项的算术平均(保留 1 位小数)。

Step 3:运行时验证(standard / full)

| 验证类型 | 深度 | 做法 | 维度 | |----------|------|------|------| | lint | standard+ | node scripts/lint-skill-package.mjs <dir> | R、C | | 触发探测 | standard+ | 3 条 prompt:应触发 / 不应触发 / 易混淆 | A | | 脚本试跑 | standard+ | 目标 skill 的 scripts/ dry-run 或 --help | R、T | | 轻量对照 | standard+ | 同任务对比有/无本 skill 的报告是否满足 rubric E3 三 checklist | E | | 业务双跑 | full | 同一业务任务 no-skill vs with-skill,比步数与交付质量 | E |

无法实跑时标注 「未验证」;未做任一对照时 E3 最高 3 分。

Step 4:生成报告与优化方案

严格按 report-template.md 输出;格式参考 example-report.md。

改版回归:若存在上次报告,必须填写模板中「改版回归 diff」表。

优化方案排序:

  1. P0 — T 红线 / 会导致上架驳回或安全事故
  2. P1 — 任一分项 < 3 或维度分 < 3.5
  3. P2 — 3~4 分,改动能明显提升执行成功率或过审率
  4. P3 — polish,可上架后迭代

每条优化项格式:

- [P?] {维度}-{子项缩写} | 现状 | 建议 | 预期提升 | 涉及文件

Step 5:上架结论

| 条件 | 结论 | |------|------| | T 红线 | ❌ 不可上架 | | 任一分项 < 2 | ❌ 不可上架 | | 维度均 ≥ 3 且综合 ≥ 3.5 | ⚠️ 有条件上架(列出 P1) | | 全维 ≥ 3.5 且 T ≥ 4 | ✅ 建议上架 | | 全维 ≥ 4 且 E ≥ 4 | ✅ 优质,可冲精选 |

综合分 = 五维加权:T 30% + E 25% + A 20% + R 15% + C 10%(T/E 加重,与上架决策一致)。

交付物

  1. TRACE评测报告-{skill-name}-{YYYY-MM-DD}.md(默认写在 skill 根目录或用户指定路径)
  2. 优化 backlog(报告内「优化方案」章节;改版时含 diff 表)
  3. 口头摘要:综合分、是否可上架、Top 3 必改项

参考

| 文档 | 内容 | |------|------| | references/rubric.md | 5 维 15 子项评分标准 | | references/quick-checklist.md | quick 深度 Y/N 清单 | | references/security-checklist.md | T 维安全与合规 | | references/report-template.md | 报告与回归 diff 模板 | | references/example-report.md | 节选示例报告 | | scripts/lint-skill-package.mjs | 机械门禁脚本 | | SkillHub TRACE 教程 | 平台官方说明 | | TRACE 评测体系详解 | 维度解读 |