Visual Summarization Skill | 视觉摘要智述技能

对视频/图片进行AI分析生成场景描述

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Visual Summarization Skill | 视觉摘要智述技能。
它的用途是:对视频/图片进行AI分析生成场景描述
完整的 Skill 内容见:https://321skill.com/skills/visual-summary-generator-2/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请分析这段视频片段,生成一段描述其场景的文字。' 技能会输出类似:'画面中一个穿着红色外套的女孩在公园里奔跑,周围是绿树和草地,阳光明媚,远处有几个人在散步。' 这样的描述,帮助快速理解视觉内容。

介绍

在视频内容创作、监控分析、无障碍辅助等场景中,人工描述视频画面费时费力。本技能自动分析视频片段或图片,生成自然流畅的场景描述,帮助用户快速理解视觉内容,提升内容生产效率和信息获取速度。

使用方法:将视频文件或图片作为输入,技能会逐帧或整体分析画面中的物体、动作、环境、人物关系等要素,输出一段通顺的文字描述。支持单张图片和短视频片段(建议时长不超过30秒),描述风格可调整详细程度和侧重点。

适合用户:内容创作者(为视频配文案、字幕),视频剪辑师(快速生成素材说明),学术研究者(分析实验视频或野外记录),数据分析师(监控视频摘要),以及对无障碍有需求的人员(为视障人士提供画面描述)。

使用建议:输入清晰、关键帧丰富的视频片段可获得更准确描述;复杂场景可补充提示词指定关注重点。注意本技能仅生成文字,不生成图像,也不支持音频分析和情感判断。

常见问题

支持哪些视频格式?

支持常见格式如MP4、AVI、MOV等,建议时长不超过30秒,分辨率不低于480p。

能识别视频中的文字吗?

主要识别场景和物体,文字识别能力有限,建议配合OCR技能使用。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/visual-summary-generator-2/raw/index.md 读取 Visual Summarization Skill | 视觉摘要智述技能 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。