@smoose/pi-vision

让纯文本模型通过本地CLI工具识别图片。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:@smoose/pi-vision。
它的用途是:让纯文本模型通过本地CLI工具识别图片。
完整的 Skill 内容见:https://321skill.com/skills/smoose-pi-vision/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“请使用 pi-vision 分析一下当前目录下的 ‘chart.png’ 这张图,并总结趋势。” 它会先调用本地配置的识别服务,将图片转换为文本描述,然后基于这段描述为你生成清晰的数据趋势分析报告。

介绍

Pi-Vision 主要解决了纯文本大语言模型(LLM)无法直接处理和理解图像内容的痛点。它作为一个桥梁,通过调用本地命令行图像识别服务(如 Codex 或 Agy),将图像内容转换为详细的文本描述,再提供给后续的文本模型进行分析或对话,从而为原本“看不见”的模型赋予了“视觉”能力。

使用方式非常直接。用户需要在本地环境中配置好兼容的图像识别CLI工具(例如安装并设置好 Codex 或 Agy),然后在与文本模型交互时,通过 Pi-Vision 提供的接口或命令来引用图像文件。该工具会自动调用本地服务识别图像,并将生成的描述文本无缝集成到对话上下文中,供模型参考。

这个工具非常适合那些主要依赖纯文本模型(如某些版本的 Claude、GPT 或本地部署的 LLM)进行工作,但偶尔又需要处理图像信息的开发者、研究人员或技术爱好者。例如,在分析图表截图、理解界面设计或处理带有图片的文档时,它能显著扩展工作流的能力边界。

使用建议方面,请确保您本地的图像识别CLI工具运行正常且网络通畅,因为识别的质量和速度高度依赖这些底层服务。此外,生成的描述文本的准确性和详细程度取决于所选用的识别引擎,对于复杂或专业性强的图像,可能需要人工复核结果。

核心特点

与许多依赖云端API或集成特定模型的服务不同,Pi-Vision 的核心在于其“本地CLI代理”架构,它不绑定某个固定的AI视觉模型,而是灵活对接用户本地已安装的任何兼容命令行图像识别工具(如Codex或Agy),在保护隐私和提供配置自由度的同时完成视觉任务。

注意事项

不适合对图像识别实时性要求极高或本地无法安装/运行指定CLI工具的场景。

常见问题

支持哪些本地图像识别工具?

目前明确支持 Codex 和 Agy 这两种CLI工具,具体配置请参考其各自文档。

需要联网使用吗?

核心工具本身不必须,但您本地安装的识别工具(如Codex)可能需要联网调用其模型API。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/smoose-pi-vision/raw/index.md 读取 @smoose/pi-vision 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。