qwenspeak
通过SSH调用Qwen3-TTS生成语音,支持克隆和设计声音
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:qwenspeak。 它的用途是:通过SSH调用Qwen3-TTS生成语音,支持克隆和设计声音 完整的 Skill 内容见:https://321skill.com/skills/qwenspeak-x-7/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'用 qwenspeak 克隆我的声音,生成一段介绍新产品的中文配音,语气要热情。' 它会先要求你提供一段你的声音样本(如10秒录音),然后通过SSH连接远程服务器,调用Qwen3-TTS生成语音,最后返回一个音频文件,可直接用于产品宣传视频。
介绍
解决什么问题:当你需要将文字快速转化为自然流畅的语音,或希望克隆特定人的声音、设计全新的音色时,qwenspeak 能帮你一键完成。它通过 SSH 远程调用 Qwen3-TTS 模型,避免本地 GPU 资源占用,同时支持预设声音、声音克隆和声音设计三种模式,覆盖从简单配音到专业级语音定制的需求。
怎么用:安装后,只需提供 SSH 连接信息(服务器地址、密钥等),即可通过命令行或 API 发送文本,选择预设声音(如男声、女声、童声),或上传一段音频样本进行声音克隆,也可以调整音色参数(如音高、语速、情感)来设计全新声音。生成的语音直接返回音频文件或流,可集成到视频制作、播客、课件等场景中。
适合谁:内容创作者(为视频、播客配音)、视频剪辑师(快速生成旁白)、营销专员(制作宣传语音素材)、教育工作者(制作课程讲解音频)、以及任何需要高质量语音合成的个人或团队。
使用建议:使用前确保 SSH 目标服务器已安装 Qwen3-TTS 环境,并正确配置密钥。声音克隆需要提供清晰、无背景噪音的参考音频(建议 10-30 秒)。声音设计时,可结合情感参数(如兴奋、悲伤)增强表现力。注意:长文本生成时需留意 SSH 连接稳定性,建议分段生成。
核心特点
与本地 TTS 工具相比,qwenspeak 通过 SSH 远程调用,零本地 GPU 依赖;同时内置声音克隆和声音设计能力,而不仅仅是简单文字转语音。
注意事项
不适合需要实时低延迟交互的场景(如语音对话),SSH 网络延迟会带来明显等待。
常见问题
如何克隆声音?
提供一段干净的人声样本(10-30秒),通过 --clone 参数指定音频路径,即可生成与样本音色相似的语音。
支持哪些语言?
底层 Qwen3-TTS 支持中文、英文及多语种混合,但具体语言效果取决于模型版本。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/qwenspeak-x-7/raw/index.md 读取 qwenspeak 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/qwenspeak-x-7/raw/index.md(查看排版版本)