hellomedia

为AI宿主提供独立的多模态(图/视/音)处理能力

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:hellomedia。
它的用途是:为AI宿主提供独立的多模态(图/视/音)处理能力
完整的 Skill 内容见:https://321skill.com/skills/hellomedia/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“帮我看看这张截图里报错信息是什么?”,AI会直接调用本技能的`vision.py`脚本分析图片内容并返回描述。或者说:“画一只在太空站里穿宇航服的猫”,AI则会调用`generate.py`生成图像。

介绍

HelloMedia 是一个独立、完整的AI Agent多模态技能包,核心解决宿主主模型(如语言模型)自身无法看图、读视频、听音频的局限性。当用户消息包含图片、截图、视频、音频文件或路径,或提出视觉理解、图像/视频生成编辑、语音合成/转写等需求时,必须调用此技能,避免依赖或尝试不可靠的宿主内置能力。

使用方式清晰直接:对于图片,有文件路径则使用--image参数,若用户通过剪贴板粘贴图片(无路径),则需引导用户重新复制图片到系统剪贴板后使用--from-clipboard参数;对于视频/音频理解、生成编辑、TTS/STT等,均有对应的专用脚本(如vision.py, understand.py, generate.py, video.py, audio.py)处理。配置灵活,支持通过config.json管理多个API渠道和参数。

它适合所有需要为AI Agent(如Claude、Cursor、Trae等)增强多模态处理能力的开发者或高级用户,尤其是在宿主模型本身视觉/听觉能力缺失、不稳定或需要更可控的媒体生成流程时。

与Grok Build等环境内置的媒体工具相比,HelloMedia的核心区别在于其独立性和跨宿主通用性。它不依赖特定宿主运行时注入的工具,而是提供一套标准化的CLI脚本,可在任何支持Python的环境中运行。同时,它专门优化了对第三方API中转(Sub2API)的支持,在字段映射、用户代理等方面做了适配,确保了在非官方端点下的兼容性。

核心特点

1. 严格遵循“宿主主模型无视觉/听觉”的默认假设,强制路由多模态请求至本技能,避免先尝试宿主模型导致的失败或低质量响应。2. 深度适配API中转场景,解决了非官方端点(如`base_url`非`api.x.ai`)在图生视频字段、CDN访问策略等方面的兼容性问题。

注意事项

不适合宿主模型本身已具备强大且可靠原生多模态能力、且用户明确要求使用宿主内置工具的场景。

常见问题

用户粘贴了图片,但AI说看不到怎么办?

需引导用户“重新复制”图片到系统剪贴板(截图或Copy Image操作),然后技能使用`--from-clipboard`参数读取,而非仅复制文件路径文字。

和Grok Build自带的image_to_video工具有什么区别?

Grok工具是宿主内置的,本技能是跨宿主可用的独立实现。默认应使用本技能,仅在用户明确要求或用宿主工具更合适时才切换。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/hellomedia/raw/index.md 读取 hellomedia 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。