melo-tts-metadata-creator
自动生成 MeloTTS 训练所需的 metadata.list 文件
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:melo-tts-metadata-creator。 它的用途是:自动生成 MeloTTS 训练所需的 metadata.list 文件 完整的 Skill 内容见:https://321skill.com/skills/melo-tts-metadata-creator-x-6/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“帮我生成 MeloTTS 训练用的 metadata.list 文件,音频在 audio/ 目录,文本在 text/ 目录,单音色说话人叫张三。”它会自动扫描目录,配对 .wav 和 .txt 文件,生成符合格式的 metadata.list,如果没有 txt 文件会自动调用 Whisper 进行语音转写。
介绍
解决什么问题
为 MeloTTS 训练或微调准备数据时,需要将音频文件和对应的文本转录整理成特定格式的 metadata.list 文件。手动编写不仅繁琐,还容易出错(如路径格式、说话人标签、语言标记等)。本 Skill 自动扫描 .wav 音频和 .txt 转录文本,按 MeloTTS 官方最新标准生成 metadata.list,节省大量重复劳动。
怎么用
只需提供音频文件夹和(可选的)文本文件夹,Skill 会自动配对文件。支持单音色和多音色模式:多音色时自动按第一级子目录名提取说话人 ID;单音色时可通过 —speaker 参数强制指定。如果缺少 .txt 文件,会自动调用 Whisper 进行语音转写(支持中文、英文等多种语言)。输出格式为“音频路径|speaker|语言|文本”,可直接用于训练配置。
适合谁
内容创作者:需要批量处理语音素材来训练自定义 TTS 模型;学术研究者:在语音合成实验中快速准备数据集;高校学生:完成语音相关课程设计或毕业设计项目时简化数据预处理流程。
使用建议与注意事项
建议音频文件采样率与 MeloTTS 要求一致(通常 22050Hz 或 44100Hz),文本文件应为纯文本编码(UTF-8)。使用 Whisper 转录时需确保网络畅通或已本地部署 Whisper 模型。多音色模式下,子目录名应能准确反映说话人身份,避免重名。
核心特点
与同类工具相比,本 Skill 能自动调用 Whisper 进行语音转写,无需手动准备文本;支持单音色/多音色自动识别说话人,且严格遵循 MeloTTS 官方最新格式,减少格式兼容问题。
注意事项
不适合非 MeloTTS 格式的 TTS 训练数据准备,或需要复杂音频预处理(如降噪、分割)的场景。
常见问题
如何指定说话人名称?
单音色模式下使用 --speaker 参数;多音色模式下自动按子目录名提取。
支持哪些语言?
Whisper 转录支持中英文等多种语言,具体取决于 Whisper 模型的语言支持。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/melo-tts-metadata-creator-x-6/raw/index.md 读取 melo-tts-metadata-creator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/melo-tts-metadata-creator-x-6/raw/index.md(查看排版版本)