melo-tts-metadata-creator

为 MeloTTS 训练生成 metadata.list 的元数据工具

开发流程 学术研究者后端开发 批量处理文件语音转写文字 通用 ★ 846 更新于 2026-08-01

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:melo-tts-metadata-creator。
它的用途是:为 MeloTTS 训练生成 metadata.list 的元数据工具
完整的 Skill 内容见:https://321skill.com/skills/melo-tts-metadata-creator-x-4/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'帮我为MeloTTS训练生成metadata.list,音频在audio文件夹,文本在text文件夹,多音色模式。' 它会自动扫描两个目录,按子目录名提取speaker,匹配wav和txt文件,对缺失txt的音频调用Whisper转录,最终输出符合格式的metadata.list。

介绍

该工具解决的是 MeloTTS 训练或微调前数据准备环节的痛点:手动编写 metadata.list 文件繁琐且易出错,尤其是当音频和文本文件分散在不同目录、需要处理多音色或缺少转录文本时。它能自动扫描 .wav 音频文件和对应的 .txt 转录文本,按照 MeloTTS 官方标准格式(音频路径|speaker|语言|文本)生成 metadata.list,节省大量手工操作时间。

使用方式非常直观:只需将音频和文本文件分别放入指定目录(支持不同目录但结构一致),然后运行工具即可。单音色模式通过 —speaker 参数指定说话人名称;多音色模式会自动按第一级子目录名称提取 speaker 标识。如果某个音频缺少对应的 .txt 文件,工具会自动调用 Whisper 模型进行语音转写,支持中文、英文等多种语言,确保数据完整性。

本工具特别适合需要训练或微调 MeloTTS 模型的学术研究者、语音技术开发者以及后端工程师。无论你是为中文语音合成准备数据,还是为英文多说话人模型构建训练集,都能显著提升数据准备效率,让你更专注于模型调优本身。

使用建议:音频文件命名最好与文本文件保持一致(仅扩展名不同),以便自动匹配;多音色模式下子目录名称应尽量能反映说话人身份;对于长音频或背景噪声较大的录音,建议先人工校对 Whisper 转录结果。另外,首次运行 Whsper 转录时会自动下载模型,请确保网络畅通。

核心特点

与同类工具相比,本工具不仅自动匹配 wav 和 txt 文件,还支持多音色模式下按子目录名自动提取 speaker,并且集成 Whisper 进行零文本音频的自动转录,无需用户额外配置语音识别服务。

注意事项

要求音频文件名与文本文件名(除扩展名外)完全一致,且目录结构需符合规范;对于背景噪声大或语速极快的音频,Whisper 转录准确性可能下降。

常见问题

支持哪些语言?

支持中文、英文等常见语言,Whisper 转录时会自动检测输入音频的语言。

如何指定单音色说话人?

使用 --speaker 参数强制指定说话人名称,例如 --speaker speaker1。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/melo-tts-metadata-creator-x-4/raw/index.md 读取 melo-tts-metadata-creator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。