Large Model Visual Question Answering Skill | 大模型视觉问答技能

对任意图片进行开放式问答,返回自然语言回答

数据分析 内容创作者学术研究者产品经理 体验趣味AI功能分析设计稿 通用 ★ 1.4k 更新于 2026-08-01

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Large Model Visual Question Answering Skill | 大模型视觉问答技能。
它的用途是:对任意图片进行开放式问答,返回自然语言回答
完整的 Skill 内容见:https://321skill.com/skills/visual-question-answering-2/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请分析这张产品设计图,说出界面中所有按钮的名称和颜色,并判断它们是否对齐。' 它会识别图片中的按钮位置、颜色和标签,以自然语言描述每个按钮的属性,并给出对齐性结论。再追问:'如果要把主要按钮改为蓝色,应该调整哪些区域?' 它会基于当前图片布局给出建议。

介绍

大模型视觉问答技能(VQA)旨在解决用户无法直接向图片提问的痛点。传统图像识别只能输出预设标签或描述,而本技能结合计算机视觉与大型语言模型,支持用户对图片内容进行任意角度的开放式提问,无论是“图中有什么颜色?”、“这个场景在哪里?”还是“人物表情表达了什么情绪?”,都能得到自然语言回答。

使用方式简单:用户只需上传一张图片并输入问题,技能会调用视觉编码器提取图像特征,再由大语言模型理解问题并生成回答。整个过程无需专业编程知识,支持多轮对话追问,实现类似“看图说话”的交互体验。

本技能适合内容创作者(如分析图片素材、验证场景描述)、学术研究者(如快速提取实验图片中的信息、辅助标注)、产品经理(如分析竞品设计稿、理解用户反馈截图)等群体。无论是日常趣味探索、教学演示,还是专业图像分析,都能快速上手。

建议使用时注意图片清晰度与问题明确性:模糊或过暗的图片可能影响识别准确率;开放式问题范围越具体,回答越精准。对于需要精确数值测量的场景(如尺寸、距离),建议搭配专业工具使用。

常见问题

支持哪些图片格式?

常见格式如JPG、PNG、WEBP、BMP等均支持,建议单张图片大小不超过10MB。

能识别图片中的手写文字吗?

可以,但手写文字的识别准确率取决于字迹清晰度和书写规范程度,建议配合OCR增强提示词。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/visual-question-answering-2/raw/index.md 读取 Large Model Visual Question Answering Skill | 大模型视觉问答技能 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。