melo-tts-metadata-creator

自动生成 MeloTTS 训练所需的 metadata.list

开发流程 学术研究者后端开发高校学生 批量处理文件语音转写文字 通用 ★ 843 更新于 2026-07-31

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:melo-tts-metadata-creator。
它的用途是:自动生成 MeloTTS 训练所需的 metadata.list
完整的 Skill 内容见:https://321skill.com/skills/melo-tts-metadata-creator/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'帮我生成MeloTTS训练用的metadata.list,音频在./audio,文本在./text,多音色。' 它会自动扫描./audio下的子目录,提取speaker名称,匹配./text下对应文件,生成metadata.list。如果某个音频没有对应txt,会自动调用Whisper转录并补全。

介绍

该 Skill 解决的是 MeloTTS 训练或微调前准备数据元数据文件的痛点。用户通常需要手动整理音频路径、说话人、语言和文本信息,格式稍有差错就会导致训练失败。本工具自动扫描指定目录下的 .wav 文件和对应的 .txt 转录文本,按照 MeloTTS 官方最新标准生成 metadata.list(格式:音频路径|speaker|语言|文本),减少人工核对和格式转换的繁琐工作。

使用方式非常简单:只需提供音频文件目录和文本文件目录(可相同也可不同),工具会自动匹配。支持单音色和多音色两种模式:多音色时自动根据第一级子目录名称提取 speaker 名称;单音色时可通过 —speaker 参数强制指定说话人。如果某些音频缺少对应的 .txt 文件,工具会自动调用 Whisper 进行语音转写,支持中文、英文等多种语言,无需用户额外准备转录文本。

适合人群包括:使用 MeloTTS 进行语音合成训练或微调的学术研究者、AI 开发者,以及需要批量处理语音数据的内容创作者。尤其适合那些需要快速构建大规模 TTS 数据集、但不想手动编写 metadata 的用户。对于高校学生做毕业设计或实验,也能大幅提升数据准备效率。

使用建议:确保音频文件为 .wav 格式,文本文件为 .txt 格式且编码为 UTF-8。多音色模式下,子目录命名应保持简洁且唯一,避免特殊字符。如果使用 Whisper 自动转录,建议先确认网络环境或本地已安装 Whisper 模型,以免转录耗时过长。注意:该工具仅生成 metadata.list,不负责音频预处理(如降噪、切分),如需清洗请先处理音频。

核心特点

与其他 TTS 数据准备工具相比,本 Skill 专门对接 MeloTTS 官方格式,自动按目录结构提取 speaker 名称,并支持在无文本时无缝调用 Whisper 转录,实现了从原始音频到完整 metadata 的一站式生成。

注意事项

不适合非 MeloTTS 格式的 TTS 训练场景,也无法处理音频降噪、分割等预处理需求。

常见问题

支持哪些语言?

支持中文、英文等常见语言,Whisper 转录时自动识别语言,也可通过参数指定。

音频和文本目录必须一致吗?

不必,可以放在不同目录,只要目录结构一致即可自动匹配。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/melo-tts-metadata-creator/raw/index.md 读取 melo-tts-metadata-creator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。