turbo-whisper-local-stt

完全离线的本地高性能音频转文字工具

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:turbo-whisper-local-stt。
它的用途是:完全离线的本地高性能音频转文字工具
完整的 Skill 内容见:https://321skill.com/skills/turbo-whisper-local-stt-x-4/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

‘帮我把这个会议录音文件夹里的内容都转成文字,并标出时间点。’ 它会自动调用本地模型,离线处理文件夹内所有音频文件,最终输出一份包含完整转录文本、按发言人或段落分割、并带有精确时间戳的文档,方便您快速整理会议纪要或生成字幕。

介绍

当您需要将音频文件(如会议录音、访谈、语音笔记、视频音轨)快速、准确地转换为文字,同时又对数据隐私有严格要求时,这个技能是理想选择。它使用本地部署的Faster-Whisper模型(如large-v3-ct2),无需联网即可工作,确保您的敏感音频内容不会离开本地环境。

使用方式非常直接:您只需将音频文件(如.wav, .mp3, .m4a)或包含音频文件的文件夹提供给AI助手,并明确表达转文字的需求,技能便会自动触发。它会处理整个文件夹或单个文件,并输出包含完整文本、分段信息及时间戳的结构化结果。

该技能特别适合内容创作者、学术研究者、记者、项目经理、法务人员以及任何需要处理大量中文音频转录工作的专业人士。对于涉及商业机密、个人隐私或网络环境受限的场景,其离线特性提供了无可替代的安全保障。

请注意,技能仅支持音频格式文件,视频文件需要先提取音轨。对于极长的音频,虽然内置VAD分段优化了处理,但转录时间仍与硬件性能相关。建议在性能较好的电脑上使用,并确保有足够的存储空间存放模型。

核心特点

核心区别在于完全离线运行与对中文场景的深度优化。它使用本地Faster-Whisper模型,无需网络连接,从根本上保障隐私安全;同时针对中文长音频(如会议、访谈)内置VAD分段,并优先优化中文转录准确率,输出带时间戳的结构化文本,而非简单的纯文本结果。

注意事项

仅支持音频文件或文件夹,无法直接处理视频、图片或纯文本文件进行转录。

常见问题

支持哪些音频格式?

支持常见的wav、mp3、m4a等音频格式。

转录速度如何?准确率高吗?

速度取决于本地硬件性能,使用Faster-Whisper优化了效率。针对中文场景进行了优化,准确率较高,尤其适合会议、访谈等常见场景。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/turbo-whisper-local-stt-x-4/raw/index.md 读取 turbo-whisper-local-stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。