Speech MCP (Faster Whisper)
为Goose提供实时语音识别、TTS与音频可视化能力的MCP工具
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Speech MCP (Faster Whisper)。 它的用途是:为Goose提供实时语音识别、TTS与音频可视化能力的MCP工具 完整的 Skill 内容见:https://321skill.com/skills/speech-mcp-faster-whisper/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“请将我接下来的一段话转写成文字并总结要点。” 它会通过此Skill启动录音,将你的语音实时转写成文本,并生成摘要。或者,
对AI说:“请把这篇技术文档的核心内容读给我听。” 它会调用TTS功能,将文本转换为清晰的语音进行播放。
介绍
Speech MCP (Faster Whisper) 是一个专为Goose设计的模型上下文协议(MCP)工具,旨在解决AI助手在语音交互和音频处理方面的能力缺失。它通过集成Faster Whisper等高效引擎,为Goose添加了实时语音转文字、文字转语音以及音频波形可视化等核心功能。
使用时,用户只需在支持MCP的Goose环境中安装并配置此工具,即可通过语音与AI助手进行对话,或让AI朗读文本内容,同时还能查看音频的可视化波形图,让交互过程更加直观。
该工具非常适合需要将语音作为输入或输出媒介的场景,例如制作带旁白的演示素材、进行语音笔记、或为视障用户提供辅助。无论是内容创作者、开发者还是普通用户,只要希望在Goose中使用语音功能,都能从中受益。
建议在安装前确认Goose环境已支持MCP服务器。由于涉及实时音频处理,请确保设备麦克风和扬声器工作正常,并在网络环境良好时使用以获得最佳体验。注意,语音识别的准确性可能受背景噪音和口音影响。
核心特点
与仅提供单一语音转写或TTS功能的工具不同,本Skill将实时语音识别、高质量TTS和音频可视化三者集成于一个MCP工具中,专为Goose深度优化,实现了开箱即用的完整语音交互闭环。
注意事项
不适合对语音识别准确率要求极高(如专业字幕制作)或需要离线、完全隐私环境下进行语音处理的场景。
常见问题
这个工具支持哪些语言的语音识别和合成?
主要支持英语,中文等更多语言取决于底层Faster Whisper模型的支持范围。
需要额外的API密钥或付费吗?
不需要,它主要基于本地或开源的Faster Whisper模型运行,无需调用外部付费API。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/speech-mcp-faster-whisper/raw/index.md 读取 Speech MCP (Faster Whisper) 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/speech-mcp-faster-whisper/raw/index.md(查看排版版本)