claude-video-vision

让Claude拥有观看和理解视频的能力

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:claude-video-vision。
它的用途是:让Claude拥有观看和理解视频的能力
完整的 Skill 内容见:https://321skill.com/skills/claude-video-vision/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请分析这个产品演示视频 ~/Videos/demo.mp4,总结出三个主要功能点。' 它会自动提取关键帧并转录音频,然后结合视觉和文本信息为你生成清晰的要点总结。或者直接粘贴一个YouTube链接并提问,Claude会先下载视频再进行分析。

介绍

Claude Code Video Vision 是一个Claude Code插件,它解决了AI无法直接处理视频内容的问题。通过提取视频帧和音频转录,为Claude提供了感知视频的“眼睛”和“耳朵”,使其能够分析视频中的视觉信息和对话内容。

使用方式非常灵活,既可以通过简单的斜杠命令(如 /watch-video)直接分析本地视频或YouTube链接,也可以在对话中自然提及视频文件。Claude会根据你的问题(例如“总结这个视频”或“第一秒发生了什么”)自动调整提取帧率、时间范围和分辨率等参数。

这个技能非常适合内容创作者、视频剪辑师、学术研究者以及需要处理视频材料的学生。无论是分析教学视频内容、总结会议录像,还是提取宣传短片中的关键信息,都能大幅提升效率。

建议初次使用时运行 /setup-video-vision 命令,通过交互式向导完成配置。根据你的需求选择音频后端:追求免费和离线可使用本地Whisper,需要处理非语音事件可选用Gemini API,而OpenAI API则提供稳定的云端服务。注意,视频处理对计算资源有一定要求,分析长视频可能需要一些时间。

核心特点

与单纯提供视频摘要的工具不同,它将原始视频帧作为图像直接提供给Claude,让AI拥有第一手的视觉感知能力,而非依赖预设的摘要模型。同时,它支持YouTube URL直接输入并自动下载,保留了源数据和字幕等元信息作为上下文。

注意事项

不适合需要实时或极低延迟处理视频流的场景,且处理超长视频(如数小时)可能耗时较长。

常见问题

支持哪些视频格式?

支持ffmpeg能解码的常见格式(如mp4, mov, avi)以及YouTube等在线视频链接。

音频转录必须联网吗?

不一定,可以选择本地Whisper后端进行完全离线的音频处理。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/claude-video-vision/raw/index.md 读取 claude-video-vision 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。