melo-tts-metadata-creator

为 MeloTTS 训练自动生成 metadata.list 文件

开发流程 内容创作者学术研究者高校学生 批量处理文件语音转写文字 通用 ★ 845 更新于 2026-07-31

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:melo-tts-metadata-creator。
它的用途是:为 MeloTTS 训练自动生成 metadata.list 文件
完整的 Skill 内容见:https://321skill.com/skills/melo-tts-metadata-creator-x-2/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'帮我给这个目录下的所有wav和txt生成MeloTTS训练用的metadata.list',它会自动扫描音频目录和文本目录,匹配对应文件,生成包含音频路径、说话人、语言和文本的清单。如果缺少txt文件,会自动调用Whisper转写,最后输出一个可直接用于训练的metadata.list文件。

介绍

该 Skill 专为解决 MeloTTS 训练或微调前的数据准备痛点而设计。当您有一批 .wav 音频文件和对应的 .txt 转录文本时,手动整理 metadata.list 格式繁琐且易出错。本工具自动扫描目录,按照“音频路径|speaker|语言|文本”的官方规范生成清单,大幅节省时间并避免格式错误。

使用方式非常灵活:支持单音色和多音色模式。多音色下自动按子目录名提取说话人 ID;单音色可用 —speaker 参数指定。音频和文本文件可以放在不同目录(保持目录结构一致即可)。如果没有现成的 .txt 文件,内置 Whisper 自动转录,支持中英文等多种语言。只需在命令行中指定音频目录和输出路径,即可一键生成。

适合需要批量准备 TTS 训练数据的内容创作者、语音合成研究者、以及进行语音相关项目的高校学生。尤其适合数据量较大、需要反复迭代训练集的情况。无论您是制作有声书、虚拟主播语音库,还是训练自定义音色的 TTS 模型,都能显著提升数据处理效率。

建议在使用前确保 Whisper 模型已正确安装(若需自动转录功能)。对于已有精确文本的数据,建议提前准备好 .txt 文件以减少 Whisper 转录的潜在误差。生成后请手动抽查少量条目,确认 speaker 和语言字段正确。

核心特点

不同于通用的音频处理脚本,本 Skill 专门针对 MeloTTS 官方训练的 metadata.list 格式优化,自动适配单/多音色目录结构,并集成了 Whisper 自动转写,无需额外编写数据处理管道。

注意事项

不支持非 .wav 格式的音频;若目录结构复杂(嵌套超过两层),多音色自动识别可能失效。

常见问题

音频和文本文件必须放在同一个目录吗?

不必,可以放在不同目录,只要保持相同的子目录结构即可,工具会自动匹配。

支持哪些语言?

自动转录时支持中文、英文及其他常见语言,取决于 Whisper 模型的能力,也可手动指定语言参数。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/melo-tts-metadata-creator-x-2/raw/index.md 读取 melo-tts-metadata-creator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。