turbo-whisper-local-stt
本地高性能中文音频转文字工具
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:turbo-whisper-local-stt。 它的用途是:本地高性能中文音频转文字工具 完整的 Skill 内容见:https://321skill.com/skills/turbo-whisper-local-stt/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'把这段会议录音转成文字,输出带时间戳的分段文本',它会自动调用本地 Faster-Whisper 模型进行语音识别,返回完整文本、分段内容及对应时间戳,方便你直接整理成会议纪要或添加字幕。
介绍
你是否经常需要将会议录音、访谈音频或语音笔记快速转为文字?turbo-whisper-local-stt 是一款完全在本地运行的中文优先语音识别工具,基于 Faster-Whisper 模型,无需联网即可实现高精度音频转文字,保障数据隐私安全。
使用非常简单:直接提供音频文件(wav/mp3/m4a 等常见格式)或包含音频的文件夹,工具会自动调用本地模型进行语音识别,内置 VAD(语音活动检测)分段机制,特别适合长音频处理。输出结果包含完整文本、分段内容及对应时间戳,方便后续编辑或生成字幕。
适合需要频繁处理音频内容的用户,如内容创作者(为视频制作字幕)、视频剪辑师(提取采访素材)、项目经理(整理会议纪要)、学术研究者(转录访谈记录)等。尤其适合中文场景,对会议、访谈、课堂录音等长音频支持优秀。
建议首次使用时提前下载模型(large-v3-ct2 等),模型文件较大(约 3GB),请确保有足够磁盘空间和网络带宽。仅支持纯音频文件,视频文件需先提取音频后再处理;不支持实时流式语音识别。
核心特点
与同类音频转文字工具相比,本技能完全离线运行,数据不出本地,隐私零泄露;内置中文优化和 VAD 长音频分段,输出结构化结果(完整文本+分段+时间戳),特别适合任务型场景。
注意事项
不支持视频文件直接输入,需先提取音频;不支持实时流式识别;首次运行需下载约 3GB 模型文件。
常见问题
支持哪些音频格式?
支持 wav、mp3、m4a 等常见格式,以及整个音频文件夹批处理。
能否识别英文?
模型以中文优先,但同样支持英文和其他语言,精度略低于中文。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/turbo-whisper-local-stt/raw/index.md 读取 turbo-whisper-local-stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/turbo-whisper-local-stt/raw/index.md(查看排版版本)