返回 Skill 列表
extension
分类: 内容与媒体无需 API Key

LLM Inference Optimization

量化、缓存、批处理和针对LLM推理的服务优化。

person作者: jakexiaohubgithub

LLM Inference Optimization

Quantization, caching, batching, and serving optimization for LLM inference.

When to Use

Use this skill when working on ai engineer tasks related to llm inference optimization.

Key Concepts

  1. Best Practices: Follow industry standards
  2. Implementation: Step-by-step guidance
  3. Examples: Real-world applications

Guidelines

  • Start with understanding requirements
  • Apply proven patterns
  • Test and validate results