返回 Skill 列表
extension
分类: 开发与工程无需 API Key

vision

给类似deepseek模型没有图片识别能力的做的是一个skill,调用的是阿里的模型去识别,在claude code上完美适配

person作者: wang2621hubModelScope

Vision Skill — 图片识别能力

你的底层模型不具备原生识图能力。当用户发送图片或需要分析图片内容时,使用本 skill 调用外部 vision API 进行图片识别。

触发场景

  • 用户分享图片路径(本地或网络 URL)
  • 消息中出现 "Saved attachments:" 并列出图片
  • 用户要求分析、描述、识别图片内容
  • 用户粘贴图片或提供图片 URL

识别流程

当遇到图片时,按以下步骤操作:

步骤 1:识别图片来源

本地文件:用户提供了本地图片路径,如 C:\Users\xxx\image.png 网络 URL:用户提供了图片链接,如 https://example.com/image.jpg 直接发送:用户直接在对话中粘贴了图片(会有 "Saved attachments:" 标记)

步骤 2:调用 vision.js

使用 Bash 工具执行 Node.js 脚本。首先定位脚本路径:

脚本标准路径~/.claude/skills/vision/scripts/vision.js

如果脚本不在标准位置,向用户询问 vision.js 的实际路径,或者在当前项目目录查找。

调用命令

# 本地图片
node "~/.claude/skills/vision/scripts/vision.js" "<图片路径>" "请用中文详细描述这张图片的内容"

# 网络图片
node "~/.claude/skills/vision/scripts/vision.js" --url "<图片URL>" "请用中文详细描述这张图片的内容"

参数说明

  • <图片路径>:本地图片的绝对路径(如果路径有空格记得加引号)
  • --url:网络图片直接传 URL
  • 提示词可以根据用户需求调整

步骤 3:返回结果

vision.js 会返回图片的文本描述,直接将结果展示给用户。

vision.js 配置

首次使用时,确认以下配置:

  1. API Key:检查 scripts/vision.js 中的 DASHSCOPE_API_KEY 或设置环境变量
  2. 模型名称:检查 VISION_MODEL 配置(默认 qwen-vl-max
  3. API 地址:如使用非千问服务,修改 DASHSCOPE_BASE_URL

推荐配置

| 服务 | 模型 | API Key 获取 | |------|------|-------------| | 阿里云百炼(推荐) | qwen-vl-maxqwen3.5-omni-plus | https://bailian.console.aliyun.com/ | | OpenAI | gpt-4o-mini | https://platform.openai.com/ |

注意事项

  • 不要用 Read 工具读取图片:Read 工具无法获取图片内容
  • 逐张处理:多张图片时依次调用 vision.js
  • 等待结果:必须等 vision.js 返回结果后再回复用户
  • 错误处理:如果 vision.js 失败,检查 API Key 和网络连接