Vision Skill — 图片识别能力
你的底层模型不具备原生识图能力。当用户发送图片或需要分析图片内容时,使用本 skill 调用外部 vision API 进行图片识别。
触发场景
- 用户分享图片路径(本地或网络 URL)
- 消息中出现 "Saved attachments:" 并列出图片
- 用户要求分析、描述、识别图片内容
- 用户粘贴图片或提供图片 URL
识别流程
当遇到图片时,按以下步骤操作:
步骤 1:识别图片来源
本地文件:用户提供了本地图片路径,如 C:\Users\xxx\image.png
网络 URL:用户提供了图片链接,如 https://example.com/image.jpg
直接发送:用户直接在对话中粘贴了图片(会有 "Saved attachments:" 标记)
步骤 2:调用 vision.js
使用 Bash 工具执行 Node.js 脚本。首先定位脚本路径:
脚本标准路径:~/.claude/skills/vision/scripts/vision.js
如果脚本不在标准位置,向用户询问 vision.js 的实际路径,或者在当前项目目录查找。
调用命令:
# 本地图片
node "~/.claude/skills/vision/scripts/vision.js" "<图片路径>" "请用中文详细描述这张图片的内容"
# 网络图片
node "~/.claude/skills/vision/scripts/vision.js" --url "<图片URL>" "请用中文详细描述这张图片的内容"
参数说明:
<图片路径>:本地图片的绝对路径(如果路径有空格记得加引号)--url:网络图片直接传 URL- 提示词可以根据用户需求调整
步骤 3:返回结果
vision.js 会返回图片的文本描述,直接将结果展示给用户。
vision.js 配置
首次使用时,确认以下配置:
- API Key:检查
scripts/vision.js中的DASHSCOPE_API_KEY或设置环境变量 - 模型名称:检查
VISION_MODEL配置(默认qwen-vl-max) - API 地址:如使用非千问服务,修改
DASHSCOPE_BASE_URL
推荐配置
| 服务 | 模型 | API Key 获取 |
|------|------|-------------|
| 阿里云百炼(推荐) | qwen-vl-max 或 qwen3.5-omni-plus | https://bailian.console.aliyun.com/ |
| OpenAI | gpt-4o-mini | https://platform.openai.com/ |
注意事项
- 不要用 Read 工具读取图片:Read 工具无法获取图片内容
- 逐张处理:多张图片时依次调用 vision.js
- 等待结果:必须等 vision.js 返回结果后再回复用户
- 错误处理:如果 vision.js 失败,检查 API Key 和网络连接
微信扫一扫