ocr-super-surya
使用Surya进行GPU优化的OCR。在以下情况下使用:(1) 从图像/屏幕截图中提取文本,(2) 处理带有嵌入图像的PDF文件,(3) 多语言文档OCR,(4) 版面分析和表格检测。支持90多种语言,准确度是Tesseract的两倍。
把 Skill 的源码、资源快照、README、包体和安装信号放进一个可搜索、可筛选的公开目录。
使用Surya进行GPU优化的OCR。在以下情况下使用:(1) 从图像/屏幕截图中提取文本,(2) 处理带有嵌入图像的PDF文件,(3) 多语言文档OCR,(4) 版面分析和表格检测。支持90多种语言,准确度是Tesseract的两倍。
使用Tone.js进行音频播放,包括播放器、传输、调度和加载音频。在实现背景音乐、音效、音频同步或定时音频事件时使用。对于任何支持音频的Web应用程序来说都是必不可少的。
DSPy声明式框架,用于自动提示优化,将提示视为代码,并进行系统评估和编译
使用Azure文档智能(@azure-rest/ai-document-intelligence)从文档中提取文本、表格和结构化数据。适用于处理发票、收据、身份证件、表单或构建自定义文档处理模型时使用。
Azure AI文本分析SDK用于情感分析、实体识别、关键短语、语言检测、个人身份信息(PII)以及医疗保健自然语言处理。可用于文本的自然语言处理。
使用Exa API进行语义搜索、相似内容发现和结构化研究
通过inference.sh CLI使用Real-ESRGAN、Thera、Topaz、FLUX Upscaler放大和增强图片。模型包括:Real-ESRGAN、Thera(任意尺寸)、FLUX Dev Upscaler、Topaz Image Upscaler。用途:增强低分辨率图像、放大AI艺术作品、修复旧照片、提高分辨率。触发词:放大图片、图片放大器、增强图片、提高分辨率、real esr…
视频下载、拼接、标题幻灯片和YouTube描述。在从Google Drive下载视频、创建标题幻灯片、将多个视频拼接在一起或生成带有时间戳的YouTube描述时使用此技能。触发于视频课程创建、视频编辑、视频汇编或YouTube上传准备。
处理通话记录或文字稿 —— 提取行动项,起草跟进邮件,生成内部总结。在粘贴发现、演示或谈判通话后的粗略笔记或文字稿时使用,起草客户跟进邮件,为CRM记录活动,或为团队记录异议和下一步行动。
通过notebooklm-py Python库自动化Google NotebookLM。当用户想要执行以下操作时,使用此技能:- 创建、管理或删除NotebookLM笔记本- 向笔记本中添加来源(URL、YouTube、PDF、文件、文本、Google Drive)- 提问/与笔记本内容聊天- 生成内容:音频概览(播客)、视频概览、测验、闪卡、幻灯片、信息图、报告、数据表、思维导图- 下载生成的工…
Azure AI文档智能SDK for .NET。使用预构建和自定义模型从文档中提取文本、表格和结构化数据。
Azure AI VoiceLive SDK for Java。使用WebSocket与AI助手进行实时双向语音对话。
当用户要求“理解上下文”、“解释上下文窗口”、“设计代理架构”、“调试上下文问题”、“优化上下文使用”,或讨论上下文组件、注意力机制、渐进式披露或上下文预算时,应使用此技能。
精通向量数据库、嵌入策略和语义搜索实现。掌握Pinecone、Weaviate、Qdrant、Milvus和pgvector,用于RAG应用、推荐系统等
在一次引导会话中建立一个生产就绪的人工智能员工操作系统。输出7个可直接使用的文件:IDENTITY.md, SOUL.md, AGENTS.md, USER.md, MEMORY.md, HEARTBEAT.md, TOOLS.md。
AIPPT - 基于模板定制化生成 PPT。垫图约束风格 → 提示词替换内容 → AI 生图 → 打包 PPTX。
在使用生产跟踪数据、评估和注解优化、改进或调试LLM提示时调用此技能。涵盖从跨度中提取提示、收集性能信号以及使用ax CLI运行数据驱动的优化循环。
扫描歌词中的发音风险,防止Suno误读。在编写包含专有名词、术语、同形异义词或非英语词汇的歌词时使用。
使用Azure AI Content Safety SDK for Java构建内容审核应用程序。在实施文本/图像分析、屏蔽列表管理或仇恨、暴力、色情等内容的危害检测时使用。
Azure AI Transcription SDK for Python。用于带有时间戳和说话人分离的实时和批量语音转文字。
精通动态上下文管理、向量数据库、知识图谱和智能记忆系统的精英AI上下文工程专家。
当用户要求“优化上下文”、“减少令牌成本”、“提高上下文效率”、“实施KV-cache优化”、“分割上下文”,或提到上下文限制、观察掩码、上下文预算,或扩展有效上下文容量时,应使用此技能。
从样本中提取并记录某人真实的写作风格。当某人需要一个“声音指南”,想要捕捉他们的写作DNA,或者需要训练AI以他们的风格写作时使用。也适用于代笔、品牌声音文档化或作家入职培训。
当需要使用阿里巴巴云模型工作室的Qwen LiveTranslate模型进行实时语音翻译时,请使用此功能,包括双语会议、实时口译以及语音到语音或语音到文本的翻译流程。