Dlazy Audio Generate
根据提示词自动选择最佳音频/TTS模型
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Dlazy Audio Generate。 它的用途是:根据提示词自动选择最佳音频/TTS模型 完整的 Skill 内容见:https://321skill.com/skills/dlazy-audio-generate-x-5/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'为我的产品宣传短片生成一段30秒的激励背景音乐,风格为电子科技感',它会自动选择最佳的音频模型(如MusicGen或AudioLDM),生成并输出一个WAV文件。又如:'给这段教学视频旁白生成中文女声,语气温柔专业',它会调用TTS模型生成对应语速和情感的语音。
介绍
在内容创作中,音频素材(背景音乐、旁白、音效)往往需要反复试听和手动挑选,耗时且容易打断创作流。Dlazy Audio Generate 专为解决这一痛点而生:它根据你的自然语言描述,自动从 dlazy CLI 支持的音频/TTS 模型库中选出最匹配的模型,一键生成高质量音频。无论是想为宣传片配一段激昂的配乐,还是为教学视频录制清晰的旁白,只需一句话,它就能帮你完成模型选择与生成。
使用方法非常简单:在支持 dlazy CLI 的终端或集成环境中,直接输入你的需求,例如“为产品演示视频生成一段 30 秒的背景音乐,风格轻快科技感”。Skill 会解析你的提示词,自动匹配最佳模型(如 GPT-SoVITS、Coqui TTS、Bark 等),并输出音频文件。无需手动切换模型参数,也无需记住不同模型的能力边界。
适合内容创作者、视频剪辑师和社媒运营人员。尤其是需要频繁制作视频配乐、播客旁白、有声读物或广告音频的团队和个人。通过减少试错和模型选择时间,你可以将更多精力放在创意本身。
使用建议:尽量提供具体的风格、时长、情绪等关键词,可显著提升模型匹配准确率。注意,该 Skill 依赖 dlazy CLI 的本地模型库,首次使用可能需要下载模型(约数百 MB 到数 GB);若生成较慢,建议在 GPU 环境下运行。
核心特点
与普通TTS工具不同,它能根据提示词自动切换模型(如情感语音、多语言、音效生成),无需手动选择,减少反复试错。
注意事项
不适用于需要精细控制每个音调、节奏的专业音乐制作场景(如编曲、混音)。
常见问题
支持哪些语言?
取决于已安装的模型,常见模型支持中、英、日、韩等多语言,具体可查看 dlazy CLI 文档。
能生成音乐吗?
可以,描述风格、情绪、乐器等,它会调用合适的音频生成模型(如 MusicGen)输出音乐片段。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/dlazy-audio-generate-x-5/raw/index.md 读取 Dlazy Audio Generate 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/dlazy-audio-generate-x-5/raw/index.md(查看排版版本)