qwenspeak

基于Qwen3-TTS的语音合成与声音克隆工具

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:qwenspeak。
它的用途是:基于Qwen3-TTS的语音合成与声音克隆工具
完整的 Skill 内容见:https://321skill.com/skills/qwenspeak-x-6/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'使用预设的温柔女声,把这段文案朗读出来,输出为MP3格式:尊敬的各位用户,欢迎使用我们的新功能。' 它会通过SSH连接Qwen3-TTS服务,选择对应预设声音,生成语音文件并返回下载链接。若需要声音克隆,可提供样本音频并说:'克隆这个声音,用同样的语气朗读以下内容……'

介绍

【解决什么问题】qwenspeak 是一个通过 SSH 远程调用 Qwen3-TTS 模型的语音合成工具,支持预设语音、声音克隆和声音设计。它能帮助用户快速将文本转化为自然流畅的语音音频,适用于配音、旁白、教学演示等多种场景,尤其适合需要高质量语音输出但本地算力有限的团队或个人。

【怎么用】用户只需通过 SSH 连接到已部署 Qwen3-TTS 服务的服务器,即可使用预设语音(如温柔女声、沉稳男声)进行文本转语音,或提供少量样本语音进行声音克隆,甚至通过描述设计全新的声音特征。工具支持常见音频格式输出,如 MP3、WAV,并允许调整语速、音调等参数。

【适合谁】内容创作者需要为视频、播客、课件配音;视频剪辑师需要快速生成旁白素材;营销专员需要制作广告宣传音频;智能体开发者希望为自己的 AI 应用集成语音输出能力。

【使用建议】建议在稳定的网络环境下使用 SSH 连接,确保服务端 Qwen3-TTS 模型已正确部署。声音克隆时,提供清晰、无背景噪音的样本(建议 30 秒以上)可获得更佳效果。注意尊重他人声音版权,避免未经授权克隆他人声音。

核心特点

与其他 TTS 工具不同,qwenspeak 通过 SSH 远程调用 Qwen3-TTS,支持声音克隆和声音设计(如“低沉、磁性、带一点沙哑”),而不仅仅是预设语音合成,且无需本地 GPU 资源。

注意事项

不适合需要实时低延迟语音合成的场景(如交互式对话),且依赖 SSH 连接和远程服务的稳定性,离线时无法使用。

常见问题

支持哪些语言?

主要支持中文和英文,通过 Qwen3-TTS 模型可扩展支持更多语言,具体请参考服务端部署文档。

声音克隆需要多少样本?

建议提供 30 秒以上的清晰语音样本,样本越长、质量越高,克隆效果越好。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/qwenspeak-x-6/raw/index.md 读取 qwenspeak 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。