qwenspeak

通过SSH调用Qwen3-TTS,提供文本转语音、音色克隆与设计功能。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:qwenspeak。
它的用途是:通过SSH调用Qwen3-TTS,提供文本转语音、音色克隆与设计功能。
完整的 Skill 内容见:https://321skill.com/skills/qwenspeak/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

‘用沉稳的男声将这篇产品介绍文案转换成语音,时长控制在1分钟左右。’,它会通过SSH调用Qwen3-TTS服务,使用指定的预设音色生成音频文件并返回给您。或者,您可以说:‘克隆这段我提供的录音中的声音,然后用它来朗读这封客户邮件。’,它会先提取音色特征,再合成新的语音。

介绍

qwenspeak Skill 解决了用户在本地或远程服务器上快速生成高质量语音音频的需求。它通过SSH连接到部署了Qwen3-TTS模型的服务器,将文本转换为自然流畅的语音,并支持使用预设音色、克隆特定音色或自定义设计音色。

使用时,用户只需通过AI助手输入文本内容和音色选择指令,该Skill便会通过SSH调用远程TTS服务,生成音频文件并返回给用户。整个过程无需用户直接操作命令行或关心模型部署细节。

该Skill非常适合需要为视频配音、制作有声内容、开发语音交互应用或进行音色实验的内容创作者、开发者、产品经理和学术研究者。他们可以利用此工具快速验证想法或生产素材。

建议在使用前确保拥有可访问的、已部署Qwen3-TTS的SSH服务器。由于依赖网络和远程服务,生成速度受网络延迟和服务器负载影响,不适合对实时性要求极高的场景。注意保护用于音色克隆的源音频隐私。

核心特点

与多数基于本地API或云服务的TTS Skill不同,qwenspeak通过SSH协议直接与远程服务器上的Qwen3-TTS模型交互,提供了对最新开源TTS模型的专业级访问能力,并集成了音色克隆与设计等高级功能。

注意事项

不适合没有SSH服务器访问权限或对语音生成延迟要求极低的实时应用场景。

常见问题

需要自己部署Qwen3-TTS模型吗?

是的,您需要在一台可通过SSH访问的服务器上自行部署Qwen3-TTS模型,本Skill负责调用。

支持哪些音频格式输出?

通常输出为常见的音频格式如WAV或MP3,具体取决于后端Qwen3-TTS服务的配置。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/qwenspeak/raw/index.md 读取 qwenspeak 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。