返回 Skill 列表
extension
分类: 内容与媒体无需 API Key

ml-training-optimization

用于收敛稳定性、效率和成本控制的机器学习训练优化工作流程。当训练运行缓慢、不稳定或超出预算并需要做出优化决策时使用;不适用于通用API层或仅基础设施的更改。

person作者: jakexiaohubgithub

Ml Training Optimization

Overview

Use this skill to improve training throughput and cost while preserving model quality and stability.

Scope Boundaries

  • Use this skill when the task matches the trigger condition described in description.
  • Do not use this skill when the primary task falls outside this skill's domain.

Shared References

  • Convergence and budget rules:
    • references/convergence-and-budget-rules.md

Templates And Assets

  • Training optimization plan:
    • assets/training-optimization-plan-template.md

Inputs To Gather

  • Baseline runtime/cost/convergence behavior.
  • Resource constraints and training budget.
  • Quality guardrails to prevent regressions.
  • Candidate optimization levers (data, algorithm, infra).

Deliverables

  • Optimization plan with prioritized interventions.
  • Resource and convergence validation results.
  • Cost/quality trade-off report.

Workflow

  1. Capture baseline and bottlenecks in assets/training-optimization-plan-template.md.
  2. Apply references/convergence-and-budget-rules.md to bound risk.
  3. Run targeted optimizations with controlled experiments.
  4. Validate quality guardrails and budget impact.
  5. Publish adopted changes and rollback criteria.

Quality Standard

  • Optimization decisions preserve target quality.
  • Convergence behavior remains stable.
  • Cost and runtime improvements are measurable.

Failure Conditions

  • Stop when optimization degrades quality beyond guardrails.
  • Stop when instability increases despite speed gains.
  • Escalate when budget constraints remain unmet.