incident-responder
专家级SRE事件响应者,专注于快速解决问题
把 Skill 的源码、资源快照、README、包体和安装信号放进一个可搜索、可筛选的公开目录。
专家级SRE事件响应者,专注于快速解决问题
剧本和运行手册是待命工程师的重要工具,提供
配置双向TLS(mTLS)以实现零信任服务间通信。在实施零信任网络、证书管理或保护内部服务通信时使用。
生成cdk堆栈生成器操作。自动激活AWS技能。触发条件:cdk堆栈生成器,cdk堆栈生成器是AWS技能类别的一部分。在使用cdk堆栈生成器功能时使用。可以通过诸如“cdk堆栈生成器”、“cdk生成器”、“cdk”等短语触发。
分布式系统架构师,设计可扩展的微服务生态系统。精通服务边界、通信模式以及云原生环境中的运维优化。
当用户想要设计、运行或优化用于开发/暂存/生产环境的Cloudflare D1模式管理、迁移和数据填充时,特别是在与Hono/Workers应用程序结合使用的情况下,请使用此技能。
根据最佳实践和安全标准创建可用于生产的Kubernetes清单,包括部署、服务、配置映射和密钥。在生成Kubernetes YAML清单、创建K8s资源或实施生产级Kubernetes配置时使用。
要分析的日志文件路径(或直接粘贴日志内容)
此技能应在用户希望在Hugging Face Jobs基础设施上运行任何工作负载时使用。涵盖UV脚本、基于Docker的工作任务、硬件选择、成本估算、使用令牌进行身份验证、密钥管理、超时配置以及结果持久化。适用于包括数据处理、推理、实验、批处理作业以及任何基于Python的任务在内的通用计算工作负载。当涉及云计算、GPU工作负载,或用户提到在没有本地设置的情况下在Hugging Face基础设施上…
管理企业搜索的连接MCP源。检测可用源,引导用户连接新源,处理源优先级排序,并管理速率限制意识。
通过实现结构化日志、指标和跟踪来提高Python的可观测性,以加速事件检测和根因分析。
管理BigQuery计划查询操作。GCP技能的自动激活技能。触发条件:BigQuery计划查询,BigQuery计划查询。属于GCP技能类别的一部分。在使用BigQuery计划查询功能时使用。可以通过诸如“bigquery scheduled query”、“bigquery query”、“bigquery”等短语触发。
指导数据库迁移项目,包括引擎变更(如MySQL到PostgreSQL、Oracle到PostgreSQL、SQL Server到PostgreSQL)、版本升级、云迁移(本地到RDS/Cloud SQL/Azure Database)、模式迁移、零停机时间迁移、复制设置和数据迁移策略。涵盖同构与异构迁移、ETL过程、切换程序和回滚计划。当迁移数据库、更改数据库引擎、升级数据库版本、将数据库迁移到云…
CI/CD:GitHub Actions、GitLab CI、Jenkins、ArgoCD、GitOps、监控。
可观测性知识库。提供三大支柱(日志、指标、追踪)、结构化日志记录、分布式追踪、指标收集(RED/USE),以及用于可观测性审计和生成的SLI/SLO/SLA定义。
全面的技能,用于与Grafana的HTTP API交互,以管理仪表板、数据源、文件夹、告警、注释、用户、团队和组织。当Claude需要执行以下操作时使用:(1) 创建、读取、更新或删除Grafana仪表板;(2) 管理数据源和连接;(3) 配置告警规则、联系点和通知策略;(4) 处理文件夹和权限;(5) 管理用户、团队和服务账户;(6) 创建或查询注释;(7) 对数据源执行查询,或者通过API执行…
自动化创建GitHub仓库并将Web项目部署到Vercel。当用户要求将网站/应用程序部署到生产环境、发布项目或设置GitHub + Vercel部署时使用。
修复无服务器环境(Vercel、AWS Lambda、Netlify)中Prisma出现的“连接过多”和连接池耗尽错误。在以下情况下使用:(1) 错误“P2024: 从连接池获取新连接时超时”,(2) PostgreSQL“角色连接过多”,(3) 数据库在本地工作正常但在生产无服务器环境中失败,(4) 在负载下数据库间歇性超时。
优化GPU资源优化器的操作。自动激活ML部署的技能。触发条件:GPU资源优化器,GPU资源优化器是ML部署技能类别的一部分。在使用GPU资源优化器功能时使用。可以通过诸如“gpu资源优化器”、“gpu优化器”、“gpu”等短语触发。
创建BigQuery表创建者操作。GCP技能的自动激活技能。触发条件:bigquery表创建者,bigquery表创建者属于GCP技能类别的一部分。在使用bigquery表创建功能时使用。可以通过诸如“bigquery表创建者”、“bigquery创建者”、“bigquery”等短语触发。
使用Jaeger和Tempo实现分布式跟踪,以追踪跨微服务的请求并识别性能瓶颈。在调试微服务、分析请求流或为分布式系统实现可观测性时使用。
使用Prometheus指标和Grafana仪表板进行可观测性和监控
在Oracle Cloud Infrastructure (OCI)上部署基础架构,使用ARM64实例(符合条件的永久免费层级)。处理区隔、虚拟云网络(VCN)、子网、安全列表和计算实例。使用场景:设置Oracle Cloud基础架构、部署ARM64实例、解决OUT_OF_HOST_CAPACITY错误、针对永久免费层级进行优化。关键词:oracle cloud, OCI, ARM64, VM.S…
当用户想要实现货物跟踪、产品追溯性或供应链可见性时。也适用于用户提到“跟踪”、“追溯性”、“可见性”、“序列化”、“批次跟踪”、“批号跟踪”、“监管链”、“来源”、“追踪和追溯”或“货物监控”的情况。对于控制塔,请参阅control-tower-design。对于合规性管理,请参阅compliance-management。