agent-media
一站式AI智能体多媒体处理工具,支持图像、视频、音频的生成与编辑。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:agent-media。 它的用途是:一站式AI智能体多媒体处理工具,支持图像、视频、音频的生成与编辑。 完整的 Skill 内容见:https://321skill.com/skills/agent-media/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“为我的博客文章‘未来城市’生成一张封面图,并去掉背景。”,它会调用 `image-generate` 和 `image-remove-background` 技能,生成并处理图片。或者
对AI说:“把刚才录制的产品演示视频转成文字稿。”,它会调用 `audio-transcribe` 技能完成音频转录。
介绍
agent-media 是一个专为AI智能体设计的命令行多媒体处理工具,旨在解决智能体在自动化流程中处理图像、视频、音频等多媒体内容的需求。它通过统一的CLI接口,集成了从生成、编辑到转换等多种功能,让智能体能够轻松调用复杂的媒体处理能力。
使用方式非常灵活,既可以通过npm全局安装,也可以直接通过npx/bunx运行,无需安装。对于AI编码代理(如Claude Code, Cursor),还可以通过 npx skills add 命令将一系列细分的媒体处理技能(如生成图片、编辑图片、转录音频等)直接添加到智能体的技能库中,使其在编码或自动化任务中能自动调用这些功能。
该工具非常适合需要集成多媒体处理能力的开发者、内容创作者和自动化流程构建者。无论是为博客生成配图、为视频剪辑提取音频和字幕,还是在开发AI应用时集成图像生成功能,agent-media都能提供便捷的解决方案。
需要注意的是,部分高级AI功能(如图像生成、视频生成)需要配置第三方AI服务的API密钥(如fal.ai、Replicate)。而基础的文件格式转换、裁剪、音频提取等功能则可以在本地直接运行,无需密钥。
核心特点
与单一功能的图像或音频处理库不同,agent-media将图像、视频、音频三大类媒体处理功能整合进一个统一的CLI工具,并专门为AI智能体设计了可安装的“技能包”,使得AI代理能像调用内置函数一样直接使用这些多媒体处理能力,极大简化了智能体工作流的集成复杂度。
注意事项
其高级AI生成功能依赖外部云服务API,需要网络和付费密钥,不适合完全离线或对成本敏感的场景。
常见问题
使用agent-media需要付费吗?
基础的本地处理功能(如格式转换、裁剪)免费。但图像生成、AI编辑、视频生成等高级功能需要调用第三方AI服务(如fal.ai),会产生相应API费用。
如何让我的AI编码助手(如Cursor)使用这些功能?
运行 `npx skills add agntswrm/agent-media`,即可将一系列媒体处理技能添加到你的AI助手技能库中,之后在对话中它就能自动调用相关功能。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/agent-media/raw/index.md 读取 agent-media 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/agent-media/raw/index.md(查看排版版本)