melo-tts-metadata-creator
为 MeloTTS 训练自动生成 metadata.list 文件
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:melo-tts-metadata-creator。 它的用途是:为 MeloTTS 训练自动生成 metadata.list 文件 完整的 Skill 内容见:https://321skill.com/skills/melo-tts-metadata-creator-x-2/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'帮我给这个目录下的所有wav和txt生成MeloTTS训练用的metadata.list',它会自动扫描音频目录和文本目录,匹配对应文件,生成包含音频路径、说话人、语言和文本的清单。如果缺少txt文件,会自动调用Whisper转写,最后输出一个可直接用于训练的metadata.list文件。
介绍
该 Skill 专为解决 MeloTTS 训练或微调前的数据准备痛点而设计。当您有一批 .wav 音频文件和对应的 .txt 转录文本时,手动整理 metadata.list 格式繁琐且易出错。本工具自动扫描目录,按照“音频路径|speaker|语言|文本”的官方规范生成清单,大幅节省时间并避免格式错误。
使用方式非常灵活:支持单音色和多音色模式。多音色下自动按子目录名提取说话人 ID;单音色可用 —speaker 参数指定。音频和文本文件可以放在不同目录(保持目录结构一致即可)。如果没有现成的 .txt 文件,内置 Whisper 自动转录,支持中英文等多种语言。只需在命令行中指定音频目录和输出路径,即可一键生成。
适合需要批量准备 TTS 训练数据的内容创作者、语音合成研究者、以及进行语音相关项目的高校学生。尤其适合数据量较大、需要反复迭代训练集的情况。无论您是制作有声书、虚拟主播语音库,还是训练自定义音色的 TTS 模型,都能显著提升数据处理效率。
建议在使用前确保 Whisper 模型已正确安装(若需自动转录功能)。对于已有精确文本的数据,建议提前准备好 .txt 文件以减少 Whisper 转录的潜在误差。生成后请手动抽查少量条目,确认 speaker 和语言字段正确。
核心特点
不同于通用的音频处理脚本,本 Skill 专门针对 MeloTTS 官方训练的 metadata.list 格式优化,自动适配单/多音色目录结构,并集成了 Whisper 自动转写,无需额外编写数据处理管道。
注意事项
不支持非 .wav 格式的音频;若目录结构复杂(嵌套超过两层),多音色自动识别可能失效。
常见问题
音频和文本文件必须放在同一个目录吗?
不必,可以放在不同目录,只要保持相同的子目录结构即可,工具会自动匹配。
支持哪些语言?
自动转录时支持中文、英文及其他常见语言,取决于 Whisper 模型的能力,也可手动指定语言参数。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/melo-tts-metadata-creator-x-2/raw/index.md 读取 melo-tts-metadata-creator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/melo-tts-metadata-creator-x-2/raw/index.md(查看排版版本)