talkies

自托管OpenAI兼容语音服务,ASR与TTS

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:talkies。
它的用途是:自托管OpenAI兼容语音服务,ASR与TTS
完整的 Skill 内容见:https://321skill.com/skills/talkies-x-5/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请帮我部署Talkies服务,并调用/v1/audio/transcriptions接口将这段会议录音转写成文字,输出为SRT格式的字幕。' 它会自动拉取Docker镜像启动服务,然后使用curl命令上传音频文件并返回转写结果,最终生成字幕文件。

介绍

Talkies 是一个完全自托管的语音服务,提供与 OpenAI API 兼容的接口,让您可以在自己的服务器上运行语音识别(ASR)和语音合成(TTS)功能。它解决了对外部语音 API 的依赖问题,同时保障数据隐私和自定义能力。无论是将音频转写为文字,还是将文字合成为自然语音,Talkies 都能高效完成。

使用非常简单:Talkies 暴露了 /v1/audio/transcriptions/v1/audio/speech 两个端点,您可以像调用 OpenAI 的语音 API 一样调用它。它支持 12 种开源 ASR 模型(包括 Whisper、Parakeet、Nemotron-3.5-ASR 等),并可通过 WebSocket 接收实时 PCM 音频流进行流式转写。TTS 方面,它集成了 Kokoro-82M(41 种内置语音,支持 PyTorch 和 ONNX 运行时)和 Qwen3-TTS 系列(需 CUDA,支持语音克隆、预设说话人和语音设计)。此外,还提供立体声说话人分离、URL 抓取、MCP 端点和 Bearer 认证等高级功能。

适合需要自建语音能力的开发者、智能体应用开发者、内容创作者以及隐私敏感的场景。例如,搭建内部语音转写服务、为客服机器人添加语音交互、批量生成视频字幕或配音、提取会议录音文字等。后端开发人员可以快速集成,智能体开发人员可以将其作为语音模块,视频剪辑师和内容创作者也能利用它高效处理音频素材。

建议在使用前根据硬件条件选择合适的模型:如果仅需 CPU 推理,优先使用 Kokoro-82M 的 ONNX 运行时;如需语音克隆或高质量合成,则需准备 CUDA 环境。流式转写适合实时场景,但需注意网络延迟和音频格式兼容性。另外,部署时务必配置好 Bearer 认证以防止未授权访问。

核心特点

与同类自托管语音服务相比,Talkies 同时支持 12 种 ASR 模型和 2 种 TTS 引擎,并原生兼容 OpenAI 的 API 格式,无需修改代码即可替代 OpenAI 的语音接口。此外,它还内置了立体声说话人分离、URL 音频抓取和 MCP 协议支持,适合需要多模型切换和高级功能的场景。

注意事项

Qwen3-TTS 系列需要 CUDA 显卡,且模型体积较大,不适合纯 CPU 或资源受限的环境;流式转写仅支持 PCM 格式,需客户端自行转换。

常见问题

Talkies 支持哪些语音识别模型?

支持 Whisper、Parakeet、Nemotron-3.5-ASR、Canary、Sherpa-ONNX、Vosk 等 12 种开源 ASR 模型。

需要什么硬件才能运行?

ASR 模型可在 CPU 上运行,但推荐使用 GPU 加速。TTS 中的 Kokoro-82M 支持 CPU(ONNX 运行时),Qwen3-TTS 必须使用 NVIDIA GPU(CUDA)。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/talkies-x-5/raw/index.md 读取 talkies 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。