Speech MCP (Faster Whisper)

为Goose提供实时语音识别、TTS与音频可视化能力的MCP工具

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Speech MCP (Faster Whisper)。
它的用途是:为Goose提供实时语音识别、TTS与音频可视化能力的MCP工具
完整的 Skill 内容见:https://321skill.com/skills/speech-mcp-faster-whisper/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“请将我接下来的一段话转写成文字并总结要点。” 它会通过此Skill启动录音,将你的语音实时转写成文本,并生成摘要。或者,

对AI说:“请把这篇技术文档的核心内容读给我听。” 它会调用TTS功能,将文本转换为清晰的语音进行播放。

介绍

Speech MCP (Faster Whisper) 是一个专为Goose设计的模型上下文协议(MCP)工具,旨在解决AI助手在语音交互和音频处理方面的能力缺失。它通过集成Faster Whisper等高效引擎,为Goose添加了实时语音转文字、文字转语音以及音频波形可视化等核心功能。

使用时,用户只需在支持MCP的Goose环境中安装并配置此工具,即可通过语音与AI助手进行对话,或让AI朗读文本内容,同时还能查看音频的可视化波形图,让交互过程更加直观。

该工具非常适合需要将语音作为输入或输出媒介的场景,例如制作带旁白的演示素材、进行语音笔记、或为视障用户提供辅助。无论是内容创作者、开发者还是普通用户,只要希望在Goose中使用语音功能,都能从中受益。

建议在安装前确认Goose环境已支持MCP服务器。由于涉及实时音频处理,请确保设备麦克风和扬声器工作正常,并在网络环境良好时使用以获得最佳体验。注意,语音识别的准确性可能受背景噪音和口音影响。

核心特点

与仅提供单一语音转写或TTS功能的工具不同,本Skill将实时语音识别、高质量TTS和音频可视化三者集成于一个MCP工具中,专为Goose深度优化,实现了开箱即用的完整语音交互闭环。

注意事项

不适合对语音识别准确率要求极高(如专业字幕制作)或需要离线、完全隐私环境下进行语音处理的场景。

常见问题

这个工具支持哪些语言的语音识别和合成?

主要支持英语,中文等更多语言取决于底层Faster Whisper模型的支持范围。

需要额外的API密钥或付费吗?

不需要,它主要基于本地或开源的Faster Whisper模型运行,无需调用外部付费API。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/speech-mcp-faster-whisper/raw/index.md 读取 Speech MCP (Faster Whisper) 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。