rlhf
理解从人类反馈中学习的强化学习(RLHF)以对齐语言模型。在学习偏好数据、奖励建模、策略优化或直接对齐算法(如DPO)时使用。
把 Skill 的源码、资源快照、README、包体和安装信号放进一个可搜索、可筛选的公开目录。
理解从人类反馈中学习的强化学习(RLHF)以对齐语言模型。在学习偏好数据、奖励建模、策略优化或直接对齐算法(如DPO)时使用。
一键综合分析某只股票/公司。通过并行子代理同时采集股价、新闻舆论、行业对比、市场环境、公司官网五个维度的数据,然后在主线程进行交叉分析、因果归因和趋势预测,输出标准化 HTML 分析报告(含当日行情和7日趋势)。触发词:分析XX股票、analyze TICKER、XX怎么样、XX值得买吗。支持A股、港股和美股。
在AI输出到达用户之前进行验证和校验。当您需要护栏、输出验证、安全检查、内容过滤、事实核查AI响应、捕捉幻觉、防止不良输出、质量关卡,或确保AI响应符合您的标准时使用。涵盖DSPy断言、验证模式以及生成-然后过滤的流水线。
当你没有足够的真实示例时,生成合成训练数据。在以下情况下使用:从零开始没有任何数据、需要快速获得概念验证、用于优化的例子太少、由于隐私或合规性原因不能使用真实客户数据、需要填补边缘情况的空白、类别不平衡、添加了新类别或更改了模式。涵盖DSPy合成数据生成、质量过滤和从零开始引导。
跟踪哪个优化实验是最好的。当您运行了多个优化过程,需要比较实验、希望重现过去的结果、需要选择最佳的提示配置、跟踪实验成本、管理优化产物、决定部署哪个优化程序或向利益相关者证明您的选择时,请使用此功能。涵盖了实验日志记录、比较以及推广到生产的过程。
实现用于回归和分类的经典机器学习算法。涵盖线性/多项式/逻辑回归、决策树、岭/Lasso正则化、训练/测试分割、交叉验证以及评估指标(R²、RMSE、精确度、召回率、F1、ROC-AUC、混淆矩阵)。在构建表格数据的预测模型、比较基线算法、处理不平衡数据时使用,或者当用户提到'回归'、'分类'、'过拟合'、'交叉验证'、'混淆矩阵'、'特征重要性'、'精确度/召回率'或'正则化'时使用。
当从多个来源(文献综述、利益相关者反馈、研究发现、不同系统的数据)综合信息时,创建或评估用于解释或解决问题的类比(跨领域迁移、“X就像Y”、结构映射),将冲突的观点整合到统一框架中,识别不同来源之间的模式,通过将一个领域的原理转移到另一个领域来寻找创新解决方案,测试类比是否成立(表面相似性与深层相似性),或者当用户提到“综合”、“结合来源”、“类比”、“像”、“类似于”、“从...转移”、“整合发…
使用AgentDB的9种强化学习算法创建和训练AI学习插件。包括决策转换器、Q学习、SARSA、演员-评论家等。在构建自学习代理、实施RL或通过经验优化代理行为时使用。
在使用Gemini模型生成图像时选择Nano Banana 1/2/Pro,优化图像生成成本,撰写图像提示词,或需要与真实世界的参考图像进行视觉定位时使用
总结YouTube视频或频道的最新视频。可用于单个视频URL、频道URL或@handle来总结最近上传的内容。
构建多个协同工作的AI代理。当您需要一个可以将任务分配给专家的主管代理、代理交接、并行研究代理、支持升级(L1到L2)、内容流程(作者+编辑+事实核查员)或任何多代理系统时使用。由DSPy提供优化代理,LangGraph负责协调。
将你的AI置于API之后。当你需要将AI功能作为Web端点提供、向现有后端添加AI、部署可供其他服务调用的AI、使用REST/HTTP封装DSPy程序、构建AI微服务或将语言模型置于FastAPI之后时使用。涵盖FastAPI集成、程序加载、请求/响应模型、每次请求配置、错误处理以及Docker部署等内容。
使用电影技巧、音频指导和时间戳编排为Google Veo 3.1制作专业的视频提示。在生成AI视频、创建视频提示或与Veo 3工作时使用。
根据用户提供的内容生成设计良好的信息图(PNG)。自动将文本结构化为具有网格布局的视觉模块。当用户说“信息图”、“infograph”、“做成信息图”,或希望将信息可视化为结构化的图形时使用。
多模态分析专家,分析 PDF/图片/视频/音频/图表/架构图/截图。
通过编写和执行自包含的Python脚本来进行全面的数据分析、统计建模和数据可视化。当您需要分析数据集、执行统计测试、创建可视化或使用可重复的基于代码的工作流程构建预测模型时,请使用此方法。
BibiGPT CLI用于直接在终端中总结视频、音频和播客。当用户想要总结一个URL(如YouTube、Bilibili、播客等)或检查他们的BibiGPT认证状态时使用。需要安装了BibiGPT桌面应用程序并处于有效登录会话,或者设置了BIBI_API_TOKEN环境变量。
使用ImageMagick转换和处理图像。涵盖格式转换、调整大小、批量处理、质量调整和图像变换。当用户提到图像转换、调整图像大小、ImageMagick、magick命令、批量图像处理或缩略图生成时使用。
让你的人工智能遵循规则和政策。当你的AI违反格式规则、违反内容政策、忽略业务约束、输出无效JSON、超出长度限制、包含禁止内容或不符合你的规范时使用。涵盖DSPy Assert/Suggest用于硬性和软性规则、内容政策、格式强制执行、重试机制以及组合多个约束条件。
让你的AI每次给出相同的答案。当AI对相同的问题给出不同的答案、输出不可预测、运行之间的响应不同、你需要确定性的AI行为或你的AI不可靠时使用。涵盖DSPy一致性技术——温度、类型化输出、断言和优化。
关于查询机器学习模型排行榜和基准测试(如MTEB、HuggingFace、嵌入式基准)的指导。当任务涉及在特定基准上查找表现最佳的模型、跨排行榜比较模型性能或回答有关当前基准排名的问题时,这项技能非常有用。涵盖了访问实时排行榜数据的策略、处理时间要求以及避免使用过时来源时常见的陷阱。
掌握使用Ollama、llama.cpp、vLLM和LM Studio进行本地LLM推理、模型选择、VRAM优化以及本地部署。精通量化格式(GGUF, EXL2)和本地AI隐私保护。
下载YouTube视频,并可自定义质量和格式选项。当用户请求下载、保存或抓取YouTube视频时使用此技能。支持多种质量设置(最佳、1080p、720p、480p、360p)、多种格式(mp4、webm、mkv)以及仅音频的MP3下载。
在设置或运行自主股票交易操作时使用此技能。系统会持续研究股票,在没有人工输入的情况下做出交易决策,在Alpaca纸面交易上执行交易,并发送Telegram通知。基于AI-Trader的自主代理模式。