talkies

自托管OpenAI兼容语音服务,支持ASR与TTS

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:talkies。
它的用途是:自托管OpenAI兼容语音服务,支持ASR与TTS
完整的 Skill 内容见:https://321skill.com/skills/talkies-x-6/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'使用 Talkies 将这段会议录音转写成文字,并提取发言人标签。' 它会调用 Talkies 的 /v1/audio/transcriptions 接口,返回带时间戳和说话人识别的文本。或者说:'将这份演讲稿用 Talkies 的 Kokoro 语音合成,生成女声朗读的音频文件。' 它会调用 /v1/audio/speech 接口,返回合成的音频数据。

介绍

Talkies 是一个完全自托管的语音服务,兼容 OpenAI 的音频 API 格式,旨在解决语音转文字(ASR)和文字转语音(TTS)的本地化部署需求。它内置了 12 种开源 ASR 模型(如 Whisper、Parakeet、Nemotron-3.5-ASR 等)和 2 个 TTS 引擎(Kokoro-82M 与 Qwen3-TTS 系列),支持立体声说话人分离、实时流式转录、语音克隆以及预设语音设计,让用户无需依赖外部云服务即可获得高质量的语音处理能力。

使用 Talkies 非常简单:部署后通过标准的 REST API 或 WebSocket 进行调用。例如,将音频文件发送至 /v1/audio/transcriptions 即可获得带时间戳和说话人标签的转录文本;通过 /v1/audio/transcriptions/stream 可接收实时 PCM 音频流;调用 /v1/audio/speech 则能根据文本生成自然语音,支持 41 种内置音色和自定义语音克隆。所有 API 均兼容 OpenAI 的请求/响应格式,因此可无缝替换现有的 OpenAI 语音服务。

Talkies 特别适合内容创作者、视频剪辑师和后端开发者。内容创作者可用它快速转写采访录音、生成播客字幕;视频剪辑师可提取视频中的对白字幕,或为演示素材添加配音;后端开发者则能将其集成到自研产品中,为用户提供低延迟、可定制的语音交互能力,同时确保数据隐私不外泄。

使用前需注意:Talkies 的 ASR 和 TTS 模型推理依赖本地计算资源,尤其是 Qwen3-TTS 引擎仅支持 CUDA,需要配备 NVIDIA GPU 才能发挥全部性能。建议在部署时根据硬件选择合适模型,并配置 Bearer 认证以保障 API 安全。对于对延迟要求极高的实时通信场景,可能需要进一步优化推理管线或使用更轻量的模型。

核心特点

相比 OpenAI 等云语音 API,Talkies 完全自托管,支持 12 种开源 ASR 模型和 2 种 TTS 引擎,内置语音克隆、立体声说话人分离,且兼容 OpenAI 格式,可无缝替换现有云服务,同时保护数据隐私。

注意事项

不适合需要极小延迟的实时交互场景(如即时语音对话),且部分 TTS 功能(Qwen3-TTS)仅支持 CUDA,需 NVIDIA GPU。

常见问题

如何安装和启动 Talkies?

推荐使用 Docker:`docker run -d --name talkies -p 8000:8000 nicerpc/talkies`,也可通过 git clone 源码后使用 pip 安装依赖运行。

Talkies 支持中文语音识别和合成吗?

支持。ASR 模型如 Whisper、Parakeet 等均支持多语言(含中文);TTS 引擎 Kokoro-82M 内置中英文语音,Qwen3-TTS 也支持中文语音克隆。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/talkies-x-6/raw/index.md 读取 talkies 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。