claude-video-vision
让Claude拥有观看和理解视频的能力
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:claude-video-vision。 它的用途是:让Claude拥有观看和理解视频的能力 完整的 Skill 内容见:https://321skill.com/skills/claude-video-vision/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请分析这个产品演示视频 ~/Videos/demo.mp4,总结出三个主要功能点。' 它会自动提取关键帧并转录音频,然后结合视觉和文本信息为你生成清晰的要点总结。或者直接粘贴一个YouTube链接并提问,Claude会先下载视频再进行分析。
介绍
Claude Code Video Vision 是一个Claude Code插件,它解决了AI无法直接处理视频内容的问题。通过提取视频帧和音频转录,为Claude提供了感知视频的“眼睛”和“耳朵”,使其能够分析视频中的视觉信息和对话内容。
使用方式非常灵活,既可以通过简单的斜杠命令(如 /watch-video)直接分析本地视频或YouTube链接,也可以在对话中自然提及视频文件。Claude会根据你的问题(例如“总结这个视频”或“第一秒发生了什么”)自动调整提取帧率、时间范围和分辨率等参数。
这个技能非常适合内容创作者、视频剪辑师、学术研究者以及需要处理视频材料的学生。无论是分析教学视频内容、总结会议录像,还是提取宣传短片中的关键信息,都能大幅提升效率。
建议初次使用时运行 /setup-video-vision 命令,通过交互式向导完成配置。根据你的需求选择音频后端:追求免费和离线可使用本地Whisper,需要处理非语音事件可选用Gemini API,而OpenAI API则提供稳定的云端服务。注意,视频处理对计算资源有一定要求,分析长视频可能需要一些时间。
核心特点
与单纯提供视频摘要的工具不同,它将原始视频帧作为图像直接提供给Claude,让AI拥有第一手的视觉感知能力,而非依赖预设的摘要模型。同时,它支持YouTube URL直接输入并自动下载,保留了源数据和字幕等元信息作为上下文。
注意事项
不适合需要实时或极低延迟处理视频流的场景,且处理超长视频(如数小时)可能耗时较长。
常见问题
支持哪些视频格式?
支持ffmpeg能解码的常见格式(如mp4, mov, avi)以及YouTube等在线视频链接。
音频转录必须联网吗?
不一定,可以选择本地Whisper后端进行完全离线的音频处理。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/claude-video-vision/raw/index.md 读取 claude-video-vision 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/claude-video-vision/raw/index.md(查看排版版本)