Large Model Visual Question Answering Skill | 大模型视觉问答技能
大模型视觉问答,基于图片内容自由提问
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Large Model Visual Question Answering Skill | 大模型视觉问答技能。 它的用途是:大模型视觉问答,基于图片内容自由提问 完整的 Skill 内容见:https://321skill.com/skills/large-model-visual-question-answering-skill-大模型视觉问答技能-x-6/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'这张图片里有哪些主要物体?它们之间是什么关系?',它会识别出图片中的物体(如人物、车辆、建筑物),并描述它们的位置和互动关系。例如,你可以上传一张街景照片,问'这个场景可能发生在哪个城市?',它会根据建筑风格、路牌文字等给出推测。
介绍
该技能解决的是传统图片识别只能输出固定标签或分类的问题,用户可以对任意图片进行开放式提问,获得自然语言回答。例如,询问图片中物体的关联、场景氛围、人物情绪等,不再局限于预设的识别任务。
使用方法非常简单:上传一张图片,然后输入任意问题即可。技能会自动调用计算机视觉模型提取图像特征,再结合大语言模型的理解能力生成回答。支持多轮对话,可以针对同一张图片连续追问细节。
适合内容创作者分析素材、学术研究者解读实验图像、高校学生完成课程作业、电商运营分析商品图等场景。任何需要从图片中获取深层信息的人都可以受益。
建议使用时尽量提供清晰、主体明确的图片,对于复杂场景或模糊图片,回答质量可能下降。对图片中文字内容的识别准确率取决于图片分辨率,建议配合文字识别场景使用。
核心特点
与通用图片识别技能不同,本技能支持任意开放性问题而非固定标签,且回答基于大语言模型生成,能理解上下文和隐含意图,适合需要推理和解释的场景。
注意事项
不适合对图片进行精确数值测量(如尺寸、距离)或执行需要外部知识库验证的复杂逻辑推理。
常见问题
支持哪些图片格式?
支持常见格式如JPEG、PNG、WebP,建议图片大小不超过10MB以保证处理速度。
可以离线使用吗?
需要联网调用大模型API,无法完全离线运行。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/large-model-visual-question-answering-skill-大模型视觉问答技能-x-6/raw/index.md 读取 Large Model Visual Question Answering Skill | 大模型视觉问答技能 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/large-model-visual-question-answering-skill-大模型视觉问答技能-x-6/raw/index.md(查看排版版本)