melo-tts-metadata-creator

为MeloTTS训练自动生成标准metadata.list文件

数据分析 全栈开发智能体开发学术研究者 开发AI应用训练本地大模型 通用 ★ 843 更新于 2026-07-31

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:melo-tts-metadata-creator。
它的用途是:为MeloTTS训练自动生成标准metadata.list文件
完整的 Skill 内容见:https://321skill.com/skills/melo-tts-metadata-creator-x/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“我需要为MeloTTS准备训练数据,音频在./wavs目录,文本在./txts目录。”,它会自动遍历目录,匹配文件,并生成符合格式的metadata.list文件。如果缺少某些文本,你可以接着说:“用Whisper帮我转录缺少的英文音频。”,它会调用转录模型补充文本内容。

介绍

该Skill专门解决用户在准备MeloTTS语音合成模型训练数据时,手动整理元数据文件繁琐且易出错的问题。它能够自动扫描指定目录下的.wav音频文件和对应的.txt转录文本,按照MeloTTS官方要求的格式(音频路径|speaker|语言|文本)生成metadata.list文件,极大简化了数据预处理流程。

使用方式非常灵活。用户只需提供音频和文本文件的路径,Skill即可自动处理。它支持单音色和多音色两种模式:在多音色模式下,它会根据音频文件所在的第一级子目录名称自动识别说话人;在单音色模式下,用户可以通过—speaker参数指定统一的说话人名称。此外,如果缺少转录文本,它还能自动调用Whisper模型为音频生成字幕。

这个Skill非常适合需要微调或训练MeloTTS模型的语音技术开发者、AI应用开发者以及学术研究者。无论是为特定角色创建定制化语音,还是构建多说话人语音库,它都能显著提升数据准备的效率。

在使用时,建议用户确保音频文件命名规范,并且转录文本的编码格式正确。对于需要Whisper转录的场景,请注意网络连接和计算资源,因为转录过程可能需要一定时间。同时,生成的metadata.list文件建议在投入训练前进行抽样检查,以确保格式和内容的准确性。

核心特点

与通用音频处理工具相比,它专为MeloTTS训练流程定制,直接输出其官方标准格式的元数据文件,无需二次转换;同时,它原生支持通过目录结构自动识别多说话人,并集成了Whisper转录作为后备方案,提供了从原始音频到训练就绪元数据的一站式解决方案。

注意事项

不适合处理非标准音频格式或需要复杂语音活动检测(VAD)、音素对齐等高级音频预处理的场景。

常见问题

支持哪些语言的Whisper转录?

支持中文(ZH)、英文(EN)等多种语言,具体取决于所调用的Whisper模型能力。

如何处理wav和txt文件在不同目录的情况?

只需指定两个目录的路径,Skill会自动根据一致的文件名进行匹配,目录结构无需完全相同。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/melo-tts-metadata-creator-x/raw/index.md 读取 melo-tts-metadata-creator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。