melo-tts-metadata-creator

为MeloTTS训练自动生成标准元数据文件

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:melo-tts-metadata-creator。
它的用途是:为MeloTTS训练自动生成标准元数据文件
完整的 Skill 内容见:https://321skill.com/skills/melo-tts-metadata-creator-x-7/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“帮我为MeloTTS生成训练用的metadata文件,音频在./wavs目录,文本在./txts目录。”,它会自动扫描两个目录,匹配文件并生成符合标准的metadata.list。如果你说:“这些音频没有字幕,帮我用Whisper生成中文转录。”,它会在生成元数据前,先调用Whisper模型为每个.wav文件生成对应的.txt文本。

介绍

该Skill专门解决用户在准备MeloTTS模型训练或微调数据时,手动整理和生成metadata.list文件的繁琐问题。它能够自动扫描指定目录下的.wav音频文件和对应的.txt转录文本,按照MeloTTS官方要求的标准格式(音频路径|speaker|语言|文本)生成元数据列表。

使用时,用户只需提供包含音频和文本文件的目录路径,Skill即可自动处理。它支持灵活的文件组织方式:音频和文本文件可以放在不同目录下,但需保持一致的目录结构。对于多音色数据集,它会自动根据第一级子目录名称识别说话人;对于单音色数据集,用户可以通过—speaker参数指定说话人名称。如果缺少转录文本,它还能调用Whisper模型自动为音频生成字幕。

这个Skill非常适合从事语音合成模型开发、研究或应用的人员,特别是那些需要为MeloTTS准备训练数据的前后端开发者、智能体开发者、内容创作者以及学术研究者。它能显著减少数据预处理的时间成本,降低人为错误。

建议在使用前,确保音频文件格式正确且命名规范。对于需要Whisper转录的情况,请注意网络连接和计算资源。在处理多音色数据时,建议提前规划好目录结构,以便Skill能准确提取说话人标签。

核心特点

与通用音频处理工具不同,它专为MeloTTS的metadata.list格式量身定制,并集成了多音色自动识别和可选的Whisper转录功能,实现了从原始音频到训练就绪元数据的一站式生成。

注意事项

不适合处理非标准音频格式或需要复杂文本清洗和标注的场景。

常见问题

如何为单音色数据集指定说话人?

使用 --speaker 参数,后接说话人名称即可。

没有文本文件时,支持哪些语言的转录?

支持中文(ZH)、英文(EN)等多种语言的自动转录。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/melo-tts-metadata-creator-x-7/raw/index.md 读取 melo-tts-metadata-creator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。