vision
为纯文本模型添加看图能力的Claude Code技能
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:vision。 它的用途是:为纯文本模型添加看图能力的Claude Code技能 完整的 Skill 内容见:https://321skill.com/skills/vision/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“帮我看看这张截图里的错误信息是什么?” AI会自动调用vision技能,将图片发送给视觉模型分析,并告诉你具体的报错内容和可能原因。或者,当你让AI“把这张图表的数据整理成表格”时,它也能通过此技能“看到”图表并完成数据提取。
介绍
vision是一个Claude Code技能,旨在为那些本身不具备视觉能力的纯文本大语言模型(如部分GLM、Qwen文本版等)提供图像理解功能。它通过一个简单的Python脚本,将图片发送给任意兼容OpenAI API的视觉模型(如GPT-4o、Qwen-VL、GLM-4V或本地部署的视觉模型)进行分析,并将结果以文字形式返回给主模型,从而让文本模型也能“看懂”图片。
使用方式极为简单。用户只需将包含SKILL.md和Python脚本的vision目录复制到Claude Code的skills文件夹中,并配置好视觉模型服务的环境变量(如VISION_BASE_URL和VISION_MODEL)。之后,当Claude Code中的文本模型在处理任务时遇到需要解读图片的情况,便会自动调用此技能。用户也可以手动运行脚本,直接对本地或网络图片进行OCR、图表分析、截图解读等操作。
这个技能非常适合那些主要使用文本模型进行编程、写作或分析,但偶尔需要处理截图(如报错信息、UI界面)、图表数据或包含文字的图片(OCR)的开发者、技术写作者和数据分析师。它让用户无需切换模型或工具,就能在现有工作流中无缝集成视觉能力。
与一些需要复杂安装(如MCP服务器、npm构建)的同类方案相比,vision的核心优势在于其极简和轻量。它不依赖任何外部包管理器或构建步骤,仅使用Python标准库,实现了开箱即用和跨平台兼容,大大降低了使用门槛和配置复杂度。
核心特点
与需要安装MCP服务器或进行npm/tsc构建的视觉集成方案相比,vision仅需复制文件并配置环境变量即可使用,完全基于Python标准库,实现了零依赖、零构建的极简部署。
注意事项
该技能依赖外部视觉模型API,若该服务不可用或网络连接不畅,则功能失效;同时,其分析质量完全取决于所配置的视觉模型的能力。
常见问题
vision技能支持哪些视觉模型?
支持任何提供OpenAI兼容API的视觉模型,包括云端服务(如GPT-4o、GLM-4V)和本地部署(如通过Ollama、vLLM、LM Studio运行的Qwen-VL等)。
安装后Claude Code不自动调用看图功能怎么办?
请确认vision目录已正确放置在~/.claude/skills/或项目内的.claude/skills/目录下,且环境变量VISION_BASE_URL和VISION_MODEL已正确配置并生效。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/vision/raw/index.md 读取 vision 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/vision/raw/index.md(查看排版版本)