pi-vision-tool
为Pi Agent添加图像描述工具,赋能非多模态模型
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:pi-vision-tool。 它的用途是:为Pi Agent添加图像描述工具,赋能非多模态模型 完整的 Skill 内容见:https://321skill.com/skills/pi-vision-tool/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“请描述一下这张图片https://example.com/chart.png的主要内容。”,它会调用`describe_image`工具,获取视觉模型对图片的文本描述,然后基于该描述为你总结图表的关键信息或回答相关问题。
介绍
该Skill解决了非多模态AI模型(如纯文本模型)无法理解和处理图像内容的核心痛点。它通过为Pi Agent扩展一个describe_image工具,让这些模型能够将图像分析任务委托给具备视觉能力的模型(如Qwen VL),从而间接获得“看”图的能力。
使用时,用户只需在Pi Agent中安装此Skill,当对话中涉及图像分析需求时,Agent便会自动调用该工具。用户可以提供图像URL或本地路径,工具会将图像内容转换为详细的文本描述,再返回给主模型进行后续处理。
它非常适合那些主要使用纯文本模型进行开发或工作,但偶尔需要处理图像信息的开发者、内容创作者或研究人员。例如,在分析包含图表的文档、理解用户上传的截图内容,或为图像生成描述性文本时,无需切换到专门的多模态模型。
建议在需要将图像信息整合到文本对话或工作流的场景中使用。请注意,其分析质量依赖于后端视觉模型(如Qwen VL)的能力,且主要输出是文本描述,不直接进行图像编辑或复杂的视觉推理。
核心特点
核心区别在于它专为Pi Agent设计,作为一个轻量级扩展,使原本不具备视觉能力的Pi Agent能够无缝集成并调用外部视觉模型,实现任务委托,而非提供一个独立的全功能视觉AI服务。
注意事项
不适合需要实时、高精度图像识别、图像编辑或复杂视觉推理(如空间关系判断)的场景。
常见问题
支持哪些图像格式?
通常支持常见格式如JPG、PNG,具体取决于后端视觉模型的能力。
需要自己部署视觉模型吗?
通常Skill会配置好默认的视觉模型服务(如Qwen VL),用户一般无需自行部署。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/pi-vision-tool/raw/index.md 读取 pi-vision-tool 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/pi-vision-tool/raw/index.md(查看排版版本)