qwen-voice
为智能体对话添加语音理解和语音回复能力。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:qwen-voice。 它的用途是:为智能体对话添加语音理解和语音回复能力。 完整的 Skill 内容见:https://321skill.com/skills/qwen-voice/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“用语音模式和我对话”,它会自动调用此技能,将你的语音消息转为文字处理,并用预设的 Cherry 音色或你克隆的自定义音色进行语音回复。例如,你可以说“介绍一下你自己”,智能体会用语音回答你。
介绍
qwen-voice 是一个 Agent Skill,旨在为智能体对话系统增添语音交互能力。它解决了纯文本对话缺乏临场感和便利性的问题,让用户可以通过语音与智能体进行更自然、高效的沟通。
该技能通过调用通义千问的 API,提供了从语音到文本的自动识别(ASR)、从文本到语音的合成(TTS)以及自定义语音克隆功能。用户只需安装技能并配置 API 密钥,即可在支持 Agent Skills 的宿主(如 Clawdbot)中启用语音对话。
它非常适合希望提升智能体交互体验的开发者、内容创作者以及需要构建多模态应用的团队。无论是为客服机器人增加语音入口,还是为个人助手增添语音回复,都能从中受益。
使用前请确保系统已安装 ffmpeg 和 Python 3.10+ 环境。配置时需注意,环境变量仅从指定的 .env 文件读取,而非系统环境变量,这提高了配置的集中性和安全性。
核心特点
核心区别在于提供了集成的语音克隆功能,允许用户仅凭一段语音样本即可创建自定义音色进行回复;同时,其环境变量管理采用用户级和项目级 .env 文件,而非系统环境变量,配置更清晰、安全。
注意事项
不适合需要精确到单词级别的时间戳对齐,或对实时性要求极高的流式语音识别场景。
常见问题
如何配置 API 密钥?
复制 .qwen-voice 目录到 ~/.config/qwen-voice/,编辑其中的 .env 文件,填入 DASHSCOPE_API_KEY。
支持哪些音频格式?
ASR 输入会自动转换为单声道 16kHz WAV 格式;TTS 输出默认为 Telegram 友好的 .ogg (Opus) 格式。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/qwen-voice/raw/index.md 读取 qwen-voice 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/qwen-voice/raw/index.md(查看排版版本)