qwenspeak

通过SSH调用Qwen3-TTS生成语音,支持克隆和设计声音

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:qwenspeak。
它的用途是:通过SSH调用Qwen3-TTS生成语音,支持克隆和设计声音
完整的 Skill 内容见:https://321skill.com/skills/qwenspeak-x-7/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'用 qwenspeak 克隆我的声音,生成一段介绍新产品的中文配音,语气要热情。' 它会先要求你提供一段你的声音样本(如10秒录音),然后通过SSH连接远程服务器,调用Qwen3-TTS生成语音,最后返回一个音频文件,可直接用于产品宣传视频。

介绍

解决什么问题:当你需要将文字快速转化为自然流畅的语音,或希望克隆特定人的声音、设计全新的音色时,qwenspeak 能帮你一键完成。它通过 SSH 远程调用 Qwen3-TTS 模型,避免本地 GPU 资源占用,同时支持预设声音、声音克隆和声音设计三种模式,覆盖从简单配音到专业级语音定制的需求。

怎么用:安装后,只需提供 SSH 连接信息(服务器地址、密钥等),即可通过命令行或 API 发送文本,选择预设声音(如男声、女声、童声),或上传一段音频样本进行声音克隆,也可以调整音色参数(如音高、语速、情感)来设计全新声音。生成的语音直接返回音频文件或流,可集成到视频制作、播客、课件等场景中。

适合谁:内容创作者(为视频、播客配音)、视频剪辑师(快速生成旁白)、营销专员(制作宣传语音素材)、教育工作者(制作课程讲解音频)、以及任何需要高质量语音合成的个人或团队。

使用建议:使用前确保 SSH 目标服务器已安装 Qwen3-TTS 环境,并正确配置密钥。声音克隆需要提供清晰、无背景噪音的参考音频(建议 10-30 秒)。声音设计时,可结合情感参数(如兴奋、悲伤)增强表现力。注意:长文本生成时需留意 SSH 连接稳定性,建议分段生成。

核心特点

与本地 TTS 工具相比,qwenspeak 通过 SSH 远程调用,零本地 GPU 依赖;同时内置声音克隆和声音设计能力,而不仅仅是简单文字转语音。

注意事项

不适合需要实时低延迟交互的场景(如语音对话),SSH 网络延迟会带来明显等待。

常见问题

如何克隆声音?

提供一段干净的人声样本(10-30秒),通过 --clone 参数指定音频路径,即可生成与样本音色相似的语音。

支持哪些语言?

底层 Qwen3-TTS 支持中文、英文及多语种混合,但具体语言效果取决于模型版本。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/qwenspeak-x-7/raw/index.md 读取 qwenspeak 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。