nccl-communication
NVIDIA集合通信库集成,用于多GPU操作。初始化NCCL通信器、执行集合操作、配置通信拓扑、分析集合性能,并支持RCCL以兼容AMD。
把 Skill 的源码、资源快照、README、包体和安装信号放进一个可搜索、可筛选的公开目录。
NVIDIA集合通信库集成,用于多GPU操作。初始化NCCL通信器、执行集合操作、配置通信拓扑、分析集合性能,并支持RCCL以兼容AMD。
分析流程,识别工作流,定义界限和范围,并绘制专业化创建的流程要求。
生成遵循Babysitter SDK模式的流程JS文件,包括任务定义、质量门、断点以及正确的io配置。
通过使用适当的skill.name和agent.name引用更新任务定义,将技能和代理集成到流程文件中。
深厚的HTTP/1.1、HTTP/2和HTTP/3协议专业知识,用于网络协议的实现与合规
生成产品规划的道路图可视化和计划工件
字节码虚拟机设计的专家级技能,包括指令集设计、调度机制和栈/寄存器架构
使用基于DFA、表驱动和递归方法生成和手写词法分析器的专家技能
跨供应商OpenCL运行时管理和内核开发。查询平台/设备,生成可移植的OpenCL C内核代码,处理供应商特定的扩展,管理上下文和命令队列,编译并缓存程序。
线程束级编程和SIMD优化。使用线程束混洗指令、投票函数、协作组、线程束同步算法,并尽量减少线程束发散,以实现最佳GPU性能。
研究专门化领域,整理参考资料,分析最佳实践,并为新专门化的创建收集全面的知识。
Vulkan计算着色器开发和管线配置。生成GLSL/HLSL计算着色器,编译为SPIR-V,配置计算管线,管理描述符集和资源绑定,实现内存屏障和同步。
二进制和文本序列化格式、模式设计及优化的专家技能
抽象语法树设计、遍历、转换和操作模式的专家技能
专门技能,用于将定性的用户研究综合成可执行的见解。分析访谈记录,提取模式和主题,识别痛点,创建亲和图,并从研究数据中生成人物属性。
专家级的LLVM集成技能,包括中间代码生成、优化过程和本地代码生成
GPU并行算法设计模式及其实现。实现并行归约、扫描/前缀和、直方图、并行排序算法、流压缩以及针对特定GPU架构优化的工作高效模式。
生成符合Babysitter SDK约定的AGENT.md文件,包括正确的YAML前导、角色定义、专业领域以及提示模板。
针对GPU上优化模板和卷积模式实现的专家技能。设计带halos的分块模板算法,实现2D/3D卷积核,优化边界条件处理,应用时间阻塞技术,生成可分离滤波器实现,并分析模板内存带宽。
gRPC协议实现、调试和性能优化的专家技能
专门用于二进制和文本协议解析与序列化的技能。设计并验证协议消息格式,根据规范生成解析器代码,实现状态机解析,并处理字节序和字节对齐问题。
自动计算和评分用于产品优先级框架,包括RICE、ICE、MoSCoW以及自定义加权评分。标准化分数,验证输入,并生成带有置信区间的优先级排名。
为设计和实现与本地代码的外部函数接口的专业技能
实现参数多态性的专家级技能,包括类型参数边界、单态化、类型擦除、方差、高阶类型和关联类型。