@ghoulm370/pi-zai-vision

为Pi平台提供基于GLM-4.6V的多模态视觉分析工具。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:@ghoulm370/pi-zai-vision。
它的用途是:为Pi平台提供基于GLM-4.6V的多模态视觉分析工具。
详细介绍见:https://321skill.com/skills/ghoulm370-pi-zai-vision/
请根据该页面的说明完成安装。

使用示例

“帮我分析一下这张用户反馈的APP错误弹窗截图,找出可能的原因。”,它会调用OCR识别截图中的文字,并结合图像内容进行逻辑分析,给出可能的问题根源。或者

对AI说:“这是我们的新页面设计图,请生成对应的HTML结构。”,它会解析设计图中的布局和元素,输出大致的HTML和CSS代码框架。

介绍

这个Skill为Pi平台扩展了强大的多模态视觉理解能力,核心解决了用户需要分析和处理图像、视频、UI界面等视觉信息的复杂需求。它不是一个单一的指令,而是一个功能集,用户可以通过自然语言指令调用其内置的多种工具,例如上传一张截图并询问“这张图里的文字是什么?”,或提交一个UI设计稿要求“将这个界面转换成前端代码”。

使用方式非常直观,在Pi平台中激活此Skill后,用户只需像平常一样对话,但可以附加图像、视频或截图文件,并直接提出与视觉内容相关的任务请求,Skill会自动调用合适的模型工具进行处理并返回结果。

它非常适合开发者、产品经理、设计师、技术支持人员以及任何需要频繁处理视觉信息的专业人士。例如,开发者可以用它来诊断代码错误截图、将设计稿快速转化为代码框架;产品经理可以分析竞品UI差异;技术支持可以识别用户上传的问题图片。

建议在使用时,尽量提供清晰、高质量的图像以获得最佳分析效果。对于复杂的图表或专业领域图像,可以配合更具体的文字描述来引导分析方向。注意,处理视频或大量图片时可能需要更长的响应时间。

核心特点

基于智谱最新的GLM-4.6V视觉模型,在中文场景下的图像理解、OCR和UI分析方面表现突出;集成了从图像分析到UI转代码的端到端工作流,功能集成度高。

注意事项

不适合处理需要极高精度或涉及专业领域(如医学影像诊断、法律文件核验)的视觉分析任务。

常见问题

这个Skill能处理视频吗?

可以,支持对视频进行关键帧提取和分析,理解视频内容。

支持将设计图转换成哪些代码?

主要支持生成HTML/CSS等前端代码结构,具体实现细节取决于图像复杂度。