melo-tts-metadata-creator

一键生成MeloTTS训练metadata文件

开发流程 学术研究者高校学生内容创作者 批量处理文件批量处理数据 通用 ★ 845 更新于 2026-08-01

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:melo-tts-metadata-creator。
它的用途是:一键生成MeloTTS训练metadata文件
完整的 Skill 内容见:https://321skill.com/skills/melo-tts-metadata-creator-x-3/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'帮我为MeloTTS训练生成metadata,我的音频在./wav目录,文本在./txt目录,多音色模式。' 它会自动扫描目录,按子目录名称提取speaker,匹配对应的txt文件,如果没有txt则调用Whisper转录,最终输出符合格式的metadata.list文件。

介绍

在训练或微调MeloTTS语音合成模型时,需要准备符合特定格式的metadata.list文件,手动整理音频路径、说话人、语言和文本不仅繁琐,还容易出错。本工具专为解决这一痛点而生,自动扫描指定目录下的.wav音频和对应的.txt转录文本,按照MeloTTS官方最新标准生成完整的metadata.list,让你从重复劳动中解放出来。

使用方式非常灵活:支持单音色和多音色两种模式。多音色模式下,工具会自动将第一级子目录名称作为说话人(speaker)标识;单音色模式则可通过--speaker参数强制指定。如果部分音频缺少对应的txt转录文件,工具还能自动调用Whisper进行语音转写,支持中文、英文等多种语言,真正实现“有音频就能出metadata”。

主要面向需要训练或微调MeloTTS模型的开发者、学术研究人员和AI语音爱好者。无论是为个人项目制作自定义语音,还是为开源社区贡献多音色数据集,都能显著降低数据准备门槛。同时,也适合内容创作者批量处理配音素材,快速搭建TTS训练管线。

使用前请确保已安装Whisper(如需自动转录功能),并注意音频文件建议使用16kHz采样率、单声道格式。如果wav和txt文件放在不同目录,请保持目录结构一致以便工具正确匹配。生成的文件可直接用于MeloTTS的训练脚本,无需额外修改。

核心特点

与手动编写脚本或通用文件处理工具相比,本Skill专为MeloTTS设计,自动识别多音色目录结构并提取speaker名称,且内置Whisper转录,无需额外组合多个工具。

注意事项

仅适用于MeloTTS训练数据准备,不适用于其他TTS引擎或非语音合成场景。

常见问题

音频和文本文件必须放在同一个目录吗?

不需要,支持放在不同目录,但目录结构必须一致(即音频目录下的子目录名称与文本目录下的子目录名称对应)。

没有txt文件时能自动转录吗?

可以,工具会自动调用Whisper进行语音转写,支持中文、英文等多种语言,但需要提前安装Whisper并确保环境可用。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/melo-tts-metadata-creator-x-3/raw/index.md 读取 melo-tts-metadata-creator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。