turbo-whisper-local-stt
本地离线、中文优先的音频转文字工具
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:turbo-whisper-local-stt。 它的用途是:本地离线、中文优先的音频转文字工具 完整的 Skill 内容见:https://321skill.com/skills/turbo-whisper-local-stt-x-3/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请帮我转录这段会议录音,输出带时间戳的完整文本。' 它会自动调用本地Whisper模型,将音频文件转写成文字,返回包含每段起止时间的结构化文本。你也可以说:'把data文件夹里所有mp3录音转成文字,生成一个汇总文件。' 它会批量处理整个文件夹并输出合并结果。
介绍
本技能解决用户需要将音频文件(如会议录音、访谈、语音笔记、视频原声等)快速转写成文字的需求,尤其适合中文长音频场景。它完全离线运行,无需联网,保护隐私安全,避免敏感数据上传云端。
使用时,只需向AI提供音频文件(支持wav/mp3/m4a等常见格式,也支持整个音频文件夹),技能会自动调用本地Faster-Whisper模型(large-v3-ct2等)进行高性能转写。内置VAD(语音活动检测)分段机制,专为长音频优化,最终输出结构化结果:完整文本、分段文本及对应时间戳。
适合需要频繁转录会议录音、访谈记录、视频字幕的内容创作者、视频剪辑师、学术研究者,以及任何注重隐私希望本地处理音频的用户。
注意:本技能仅处理音频文件或音频文件夹,不处理视频、图片、纯文本等其他文件。建议长音频(超过30分钟)开启VAD分段以获得更准确的时间戳。首次使用会自动下载模型(约2-3GB),请确保有足够磁盘空间。
核心特点
与同类音频转写技能相比,本技能完全离线运行、隐私安全,且内置中文优先的Faster-Whisper模型,针对长音频做了VAD分段优化,输出完整文本+分段+时间戳,无需任何第三方API。
注意事项
仅处理音频文件或音频文件夹,不能处理视频、图片、纯文本等非音频文件,且首次使用需下载较大模型文件。
常见问题
支持哪些音频格式?
支持wav、mp3、m4a等常见格式,也可以传入整个音频文件夹批量处理。
需要联网吗?
不需要,完全离线运行,保护隐私。首次使用会自动下载模型,后续全离线。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/turbo-whisper-local-stt-x-3/raw/index.md 读取 turbo-whisper-local-stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/turbo-whisper-local-stt-x-3/raw/index.md(查看排版版本)