Speak
文本预处理,让TTS输出自然语音
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Speak。 它的用途是:文本预处理,让TTS输出自然语音 完整的 Skill 内容见:https://321skill.com/skills/speak-x-4/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请将以下产品介绍转为适合TTS朗读的格式,注意数字和专有名词的发音:iPhone 15 Pro Max 售价 9999 元,搭载 A17 Pro 芯片,支持 5G 网络。',Speak 会输出:'iPhone 15 Pro Max 售价 九千九百九十九元,搭载 A 十七 Pro 芯片,支持 五 G 网络。',并自动添加韵律标记和停顿,确保 TTS 朗读自然不卡顿。
介绍
Speak 是一个专为文本转语音(TTS)场景设计的文本预处理工具。它解决的核心问题是:TTS 引擎直接朗读原始文本时,往往会出现读错数字、日期、缩写,念出 Markdown 符号、URL 或代码,以及节奏死板、口音不符等问题。Speak 通过文本规范化、韵律标注、发音矫正和语音偏好设置,将输入文本转换为任何 TTS 引擎都能自然朗读的样式,显著提升语音输出的流畅度和人味。
使用方式非常简单:将需要朗读的文本(如通知、脚本、文案、对话)交给 Speak,它会自动处理并输出一份“语音就绪”的文本。这份文本已包含朗读节奏标记、正确发音标注(如“2024年”转为“二零二四年”)、以及去除了所有不适合朗读的符号。你可以直接将其送入任何 TTS 引擎,无需额外调整。
本工具适合内容创作者、营销专员、视频剪辑师、教育工作者等需要频繁制作语音内容的用户。例如:为宣传视频撰写配音脚本、生成课程讲解音频、制作语音通知、为播客准备朗读稿,或优化智能客服的语音回复。对于需要多语言、多口音或特定语速的场景,Speak 同样能通过配置语音偏好适配。
建议在使用时,先明确目标 TTS 引擎的输入规范(如 SSML 标签支持),Speak 输出为通用格式,可进一步按需调整。注意:Speak 不生成音频文件,也不支持语音转文字或实时双向通话,它仅负责文本端的预处理优化。
核心特点
与直接丢文本给 TTS 不同,Speak 专注于文本的“语音友好化”预处理,包括数字/缩写/标点规范化、韵律标记、发音字典调整,从而避免机器人腔、误读和僵硬节奏,适配任意 TTS 引擎。
注意事项
不适用于语音转文字(ASR)、实时双向通话搭建,也不直接生成音频文件。
常见问题
Speak 能直接生成语音吗?
不能,它只输出预处理后的文本(如带 SSML 标记的字符串),需要配合任何 TTS 引擎(如 Amazon Polly、Google TTS、Azure)来生成音频。
它支持哪些语言?
支持多数主流语言,通过内置的规范化规则和发音字典实现,可扩展。用户也可自定义语音偏好(如英式/美式发音、语速、语调)。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/speak-x-4/raw/index.md 读取 Speak 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/speak-x-4/raw/index.md(查看排版版本)