fluidaudio
集成FluidAudio Swift SDK,为Apple平台上的设备提供完全本地化的音频AI。FluidAudio提供了ASR(NVIDIA Parakeet TDT模型)、说话人分割、VAD和TTS——所有这些都通过CoreML在Apple神经引擎上运行,无需依赖云端。在实现以下功能时使用:(1) macOS/iOS上的离线/本地语音转文字转录,(2) 具有话音结束检测的实时流式ASR,(3)…
把 Skill 的源码、资源快照、README、包体和安装信号放进一个可搜索、可筛选的公开目录。
集成FluidAudio Swift SDK,为Apple平台上的设备提供完全本地化的音频AI。FluidAudio提供了ASR(NVIDIA Parakeet TDT模型)、说话人分割、VAD和TTS——所有这些都通过CoreML在Apple神经引擎上运行,无需依赖云端。在实现以下功能时使用:(1) macOS/iOS上的离线/本地语音转文字转录,(2) 具有话音结束检测的实时流式ASR,(3)…
语义过滤:根据`predicate`字符串评估每个集合项,并返回匹配的项(目标,谓词,[模式])
在半径R(默认/最大7)内可见的非空气方块。通过前方锥形区域(偏航角±60°,俯仰角-60..+90)和视线过滤。不会报告物品。
生成可缩放的HTML可视化空间地图,显示步行适宜性、危险因素、资源和观察置信度。
使用导航惯例和导航运动工具,将代理稳定地靠近一个坚固的垂直表面。
自动生成600x600的Instagram风格卡片新闻系列,可选背景图片。用户需提供主题、颜色以及可选图片 - Claude将生成内容并创建多张具有适当文本换行的卡片。
高级上下文模式识别,包括项目指纹识别、语义相似性分析和跨领域模式匹配,以增强学习能力
在项目级别启用自主模式识别、存储和检索,并具备自我学习能力以实现持续改进
将文本内容与自然语言谓词进行布尔测试。对于长文本具有自动分块功能(如果任何分块匹配,则返回“true”)。
使用自然语言提示通过LLM从零开始生成新的文本或代码内容。创建的内容来自LLM自身的知识——无需源文档。
半径R(默认/最大7)范围内的可见项目实体,通过前方锥形区域和视线过滤。
启用或禁用自动训练数据捕获(部分观察网格+可选的真实值)。
从OSWorld环境中获取当前观察。返回屏幕截图(base64编码的PNG)和可访问性树(JSON)。
使用OpenCV修复技术移除Gemini的标志、水印或AI生成的图像标记。当用户请求移除Gemini标志、AI水印或任何图像中的标志/水印时,使用此技能。
通用模型检测和能力评估以实现最佳跨模型兼容性
请提供需要翻译的描述内容。
从论文文本中使用大语言模型提取结构化元数据(标题、作者、年份)。用于将在线搜索结果的元数据转换为JSON
检查文本是否包含问题
查询持久化的空间地图,该地图代表了代理目前通过过去和现在的观察所了解到的关于环境的所有信息。对推理、解释和规划非常有用。
用航点名称标记坐标,以便推理空间关系。用于标记导航和规划中的重要位置
根据用户提供的主题、颜色以及可选图片自动生成600x600的Instagram风格卡片新闻系列。Claude负责生成内容并创建多个带有适当文本换行的卡片。
生成具有5个维度(类型、调色板、渲染、文本、情绪)的文章封面图片,结合9种调色板和6种渲染风格。支持电影级(2.35:1)、宽屏(16:9)和方形(1:1)比例。当用户要求“生成封面图片”、“创建文章封面”或“制作封面”时使用。
跨模型性能优化和自主代理的扩展配置
在模拟车辆运动、计算安全跟车距离、碰撞时间、速度/位置更新或为巡航控制模式实现车辆状态机时使用此技能。