melo-tts-metadata-creator
一键生成MeloTTS训练metadata文件
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:melo-tts-metadata-creator。 它的用途是:一键生成MeloTTS训练metadata文件 完整的 Skill 内容见:https://321skill.com/skills/melo-tts-metadata-creator-x-3/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'帮我为MeloTTS训练生成metadata,我的音频在./wav目录,文本在./txt目录,多音色模式。' 它会自动扫描目录,按子目录名称提取speaker,匹配对应的txt文件,如果没有txt则调用Whisper转录,最终输出符合格式的metadata.list文件。
介绍
在训练或微调MeloTTS语音合成模型时,需要准备符合特定格式的metadata.list文件,手动整理音频路径、说话人、语言和文本不仅繁琐,还容易出错。本工具专为解决这一痛点而生,自动扫描指定目录下的.wav音频和对应的.txt转录文本,按照MeloTTS官方最新标准生成完整的metadata.list,让你从重复劳动中解放出来。
使用方式非常灵活:支持单音色和多音色两种模式。多音色模式下,工具会自动将第一级子目录名称作为说话人(speaker)标识;单音色模式则可通过--speaker参数强制指定。如果部分音频缺少对应的txt转录文件,工具还能自动调用Whisper进行语音转写,支持中文、英文等多种语言,真正实现“有音频就能出metadata”。
主要面向需要训练或微调MeloTTS模型的开发者、学术研究人员和AI语音爱好者。无论是为个人项目制作自定义语音,还是为开源社区贡献多音色数据集,都能显著降低数据准备门槛。同时,也适合内容创作者批量处理配音素材,快速搭建TTS训练管线。
使用前请确保已安装Whisper(如需自动转录功能),并注意音频文件建议使用16kHz采样率、单声道格式。如果wav和txt文件放在不同目录,请保持目录结构一致以便工具正确匹配。生成的文件可直接用于MeloTTS的训练脚本,无需额外修改。
核心特点
与手动编写脚本或通用文件处理工具相比,本Skill专为MeloTTS设计,自动识别多音色目录结构并提取speaker名称,且内置Whisper转录,无需额外组合多个工具。
注意事项
仅适用于MeloTTS训练数据准备,不适用于其他TTS引擎或非语音合成场景。
常见问题
音频和文本文件必须放在同一个目录吗?
不需要,支持放在不同目录,但目录结构必须一致(即音频目录下的子目录名称与文本目录下的子目录名称对应)。
没有txt文件时能自动转录吗?
可以,工具会自动调用Whisper进行语音转写,支持中文、英文等多种语言,但需要提前安装Whisper并确保环境可用。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/melo-tts-metadata-creator-x-3/raw/index.md 读取 melo-tts-metadata-creator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/melo-tts-metadata-creator-x-3/raw/index.md(查看排版版本)