qwen-voice

为智能体对话添加语音理解和语音回复能力。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:qwen-voice。
它的用途是:为智能体对话添加语音理解和语音回复能力。
完整的 Skill 内容见:https://321skill.com/skills/qwen-voice/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“用语音模式和我对话”,它会自动调用此技能,将你的语音消息转为文字处理,并用预设的 Cherry 音色或你克隆的自定义音色进行语音回复。例如,你可以说“介绍一下你自己”,智能体会用语音回答你。

介绍

qwen-voice 是一个 Agent Skill,旨在为智能体对话系统增添语音交互能力。它解决了纯文本对话缺乏临场感和便利性的问题,让用户可以通过语音与智能体进行更自然、高效的沟通。

该技能通过调用通义千问的 API,提供了从语音到文本的自动识别(ASR)、从文本到语音的合成(TTS)以及自定义语音克隆功能。用户只需安装技能并配置 API 密钥,即可在支持 Agent Skills 的宿主(如 Clawdbot)中启用语音对话。

它非常适合希望提升智能体交互体验的开发者、内容创作者以及需要构建多模态应用的团队。无论是为客服机器人增加语音入口,还是为个人助手增添语音回复,都能从中受益。

使用前请确保系统已安装 ffmpeg 和 Python 3.10+ 环境。配置时需注意,环境变量仅从指定的 .env 文件读取,而非系统环境变量,这提高了配置的集中性和安全性。

核心特点

核心区别在于提供了集成的语音克隆功能,允许用户仅凭一段语音样本即可创建自定义音色进行回复;同时,其环境变量管理采用用户级和项目级 .env 文件,而非系统环境变量,配置更清晰、安全。

注意事项

不适合需要精确到单词级别的时间戳对齐,或对实时性要求极高的流式语音识别场景。

常见问题

如何配置 API 密钥?

复制 .qwen-voice 目录到 ~/.config/qwen-voice/,编辑其中的 .env 文件,填入 DASHSCOPE_API_KEY。

支持哪些音频格式?

ASR 输入会自动转换为单声道 16kHz WAV 格式;TTS 输出默认为 Telegram 友好的 .ogg (Opus) 格式。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/qwen-voice/raw/index.md 读取 qwen-voice 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。