spring-ai-alibaba
提供关于Spring AI Alibaba的全面指导,包括阿里云AI服务集成、模型API以及AI应用开发。当用户询问关于Spring AI Alibaba的信息、需要使用阿里云AI服务或在Spring应用中集成AI功能时,请参考此指南。
把 Skill 的源码、资源快照、README、包体和安装信号放进一个可搜索、可筛选的公开目录。
提供关于Spring AI Alibaba的全面指导,包括阿里云AI服务集成、模型API以及AI应用开发。当用户询问关于Spring AI Alibaba的信息、需要使用阿里云AI服务或在Spring应用中集成AI功能时,请参考此指南。
给视频烧录字幕。支持从本地视频自动提取文字稿(FunASR 词级时间轴),也支持手动提供 LRC/ASS 字幕文件。语种自动识别,中文字幕自动启用中英双语模式。支持目录批量处理。6种系统字体 + 本地fonts/目录自动发现,字体偏好自动记忆,6种颜色。触发词:视频加字幕、添加字幕、烧录字幕、给视频配字幕、加字幕、字幕烧录、生成字幕视频、批量加字幕、批量烧录、目录加字幕。
设备端翻译:翻译框架、系统翻译表、TranslationSession API、语言检测。在添加文本翻译、语言切换或设备端机器学习翻译功能时使用。触发条件:Translation、TranslationSession、translate、language、translationTask。
使用LigandMPNN进行配体感知的蛋白质序列设计。在以下情况下使用此技能:(1)围绕小分子设计序列,(2)酶活性位点设计,(3)配体结合口袋优化,(4)金属配位位点设计,(5)辅因子结合蛋白设计。对于标准蛋白质设计,请使用proteinmpnn。对于溶解度优化,请使用solublempnn。
智谱AI的视觉语言模型,用于图像分析、内容识别和视觉问答
使用Azure AI内容安全(@azure-rest/ai-content-safety)分析文本和图片中的有害内容。适用于审核用户生成的内容、检测仇恨言论、暴力、色情内容或自残行为,以及管理自定义屏蔽列表时使用。
使用Claude Sonnet的web_search工具搜索网络。返回一个包含综合发现的单个文本笔记。
擅长构建将AI API(如OpenAI、Anthropic等)封装成人们愿意付费使用的专注工具的产品。不仅仅是‘ChatGPT但有所不同’——而是用AI解决特定问题的产品。
将抽象/隐喻性的叙述转化为具体的视觉故事结构。使用场景:当需要将诗歌/戏剧性叙述从多样内容生成转换为逐场视觉分解,以便进行编剧格式化时。管道位置:多样内容生成 → **叙述者** → 编剧 → 生产验证者 → 想象 → 存档-验证 主要功能:在“私人祭坛”(抽象隐喻)与“女子每天回到同一个海滩地点”(可拍摄场景)之间架起桥梁。输出:具有具体视觉动作、保留情感核心及故事逻辑文档的场景分解。
形式逻辑推理和论证验证的技能
从任何内容(书籍、文章、主题、笔记、对话)生成Obsidian MarkMind富格式思维导图。每当用户要求创建思维导图、心智图、概念图或视觉摘要时,使用此技能。当用户说'markmind'、'mindmap'、'mind map'、'mappa',或者要求可视化/映射/概要化任何内容时也触发该技能。该技能处理头脑风暴、内容提取、层级设计,并输出一个.md文件,准备好粘贴到带有MarkMind插件…
为LLM应用程序构建基于向量数据库和语义搜索的检索增强生成(RAG)系统。在实现基于知识的AI、构建文档问答系统或将大型语言模型与外部知识库集成时使用。
记忆是智能代理的基石。没有它,每次交互都从零开始。这项技能涵盖了代理记忆的架构:短期(上下文窗口)、长期(向量存储)以及组织它们的认知架构。关键见解:记忆不仅仅是存储——它是检索。如果找不到正确的信息,存储的一百万个事实毫无意义。分块、嵌入和检索策略决定了你的代理是否记得或忘记。该领域是零碎的
从YouTube视频中提取文字记录,并使用智能分析框架生成全面、详细的摘要
生成小红书(小红书)信息图系列,包含10种视觉风格和8种布局。将内容分解为1-10张卡通风格的图片,优化以提高小红书上的互动率。当用户提到“小红书图片”、“小红书笔记”、“小红书配图”、“小红书种草”、“XHS images”、“XHS cards”、“RedNote infographics”,或想要适用于中国平台的社交媒体信息图时使用。
使用Azure AI内容安全(@azure-rest/ai-content-safety)分析文本和图片中的有害内容。在审核用户生成的内容、检测仇恨言论、暴力、色情等内容时使用。
Claude Computer Use - 通过截屏+视觉理解操作任意桌面应用(精确坐标点击/滚动/拖拽/键盘/右键/双击)。终极后备方案,当 peekaboo/pywinauto/browser 无法满足时使用。
用于控制节奏和动态难度的AI导演技能
使用Gemini 3 Pro处理多模态输入(图像、视频、音频、PDF)。涵盖图像理解、视频分析、音频处理、文档提取、媒体分辨率控制、OCR和令牌优化。在分析图像、处理视频、转录音频、提取PDF内容或处理多模态数据时使用。
RAG聊天机器人的详细信息,包括用户界面和后端逻辑。
自治代理是能够独立分解目标、计划行动、执行工具和自我纠正而无需持续人工指导的人工智能系统。挑战不在于使它们具备能力——而在于使它们可靠。每一个额外的决策都会增加失败的概率。此技能涵盖了代理循环(ReAct, Plan-Execute)、目标分解、反思模式以及生产可靠性。关键见解:累积错误率会扼杀自治代理。每一步95%的成功率在几步后会降至60%。
快速生成2-3个视频脚本大纲方案,包含标题建议、缩略图设计建议和完整的结构设计。当用户提到"视频大纲"、"视频脚本"、"视频策划"、"拍视频"、"视频内容"时使用此技能。
指导音频母带处理,适用于流媒体平台,包括响度优化和音调平衡。当用户已批准音轨并希望对音频文件进行母带处理时使用。
当用户要求“建模代理心理状态”、“实现BDI架构”、“创建信念-愿望-意图模型”、“将RDF转换为信念”、“构建认知代理”,或提到BDI本体、心理状态建模、理性代理,或神经符号AI集成时,应使用此技能。