talkies
自托管开源语音服务,兼容OpenAI API
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:talkies。 它的用途是:自托管开源语音服务,兼容OpenAI API 完整的 Skill 内容见:https://321skill.com/skills/talkies/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请用Talkies将这段会议录音转写为文字,并保存为Markdown文件。' 它会调用/v1/audio/transcriptions上传音频,返回转写文本,然后整理成带时间戳的会议纪要。
对AI说:'用Talkies生成一段中文语音,文本是“欢迎使用我们的产品”,选择女声预设。' 它会调用/v1/audio/speech返回WAV音频,可直接用于产品演示。
介绍
Talkies 是一个完全自托管的语音服务,提供与 OpenAI 音频 API 完全兼容的接口。它解决了在本地部署语音识别(ASR)和语音合成(TTS)能力的需求,无需依赖任何第三方云服务,数据完全掌握在自己手中。无论是将会议录音转写为文字,还是为应用生成自然语音,Talkies 都能提供开箱即用的解决方案。
使用非常简单:部署后,您可以直接调用 /v1/audio/transcriptions 上传音频文件获取转写结果,或通过 WebSocket 实时传输 PCM 音频流进行流式识别。文字转语音则通过 /v1/audio/speech 接口,支持多种说话人预设和语音克隆。所有接口与 OpenAI 的格式完全一致,现有代码只需修改 base_url 即可无缝切换。
这款工具非常适合需要本地处理敏感语音数据的团队,比如医疗、金融、法律等行业的内部系统;也适合 AI 应用开发者,希望快速集成语音能力但不想被云厂商绑定;内容创作者可以通过它批量生成配音或字幕,而无需高昂的 API 费用。
建议在部署前评估服务器硬件:ASR 模型对 CPU 和内存要求较高,推荐使用 GPU 加速;TTS 中的 Qwen3-TTS 系列仅支持 CUDA,非 NVIDIA 显卡用户可使用 Kokoro-82M 的 ONNX 运行时。另外,请确保网络环境允许访问模型下载源,首次启动会自动下载模型文件。
核心特点
Talkies 是唯一同时支持 12 种开源 ASR 模型(包括 Whisper、Parakeet、Nemotron)和 3 种 TTS 后端(含语音克隆)的 OpenAI 兼容服务,且完全自托管,无需任何外部 API 密钥。
注意事项
语音合成中的 Qwen3-TTS 系列需要 NVIDIA GPU 和 CUDA 环境,且不支持实时流式合成;ASR 实时流式仅支持 PCM 格式,需客户端自行提供音频编码。
常见问题
Talkies 支持哪些语音识别模型?
支持 Whisper、Parakeet、Nemotron-3.5-ASR、Canary、Sherpa-ONNX、Vosk 等 12 种开源 ASR 模型。
不需要 GPU 能运行吗?
可以。ASR 模型可在 CPU 上运行,但速度较慢;TTS 的 Kokoro-82M 提供 ONNX 运行时可在 CPU 上运行,而 Qwen3-TTS 必须使用 NVIDIA GPU。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/talkies/raw/index.md 读取 talkies 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/talkies/raw/index.md(查看排版版本)