turbo-whisper-local-stt

本地离线高性能中文音频转文字

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:turbo-whisper-local-stt。
它的用途是:本地离线高性能中文音频转文字
完整的 Skill 内容见:https://321skill.com/skills/turbo-whisper-local-stt-x/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请帮我转录这段会议录音,输出带时间戳的分段文本。' 它会自动调用本地Faster-Whisper模型,处理音频文件,生成包含完整文本、每段内容及起止时间的结构化结果,方便您直接用于会议纪要或字幕制作。

介绍

【解决什么问题】您是否经常需要将会议录音、采访语音、语音笔记等音频文件转为文字,又担心上传云端导致隐私泄露?本 Skill 基于 Faster-Whisper 大模型,在您的本地设备上直接完成音频转写,无需联网,数据不会离开您的电脑,完全保障隐私安全。特别针对中文长音频进行了优化,内置 VAD(语音活动检测)自动分段,即使一小时以上的会议录音也能准确识别并生成带时间戳的结构化文本。

【怎么用】使用非常简单:您只需提供一个音频文件(wav/mp3/m4a 等常见格式)或包含多个音频的文件夹路径,Skill 会自动调用本地模型进行转写。首次运行会自动下载 large-v3-ct2 等模型(约 2-3GB),之后离线使用。输出结果包含完整文本、按语意分段后的文本列表以及每段对应的时间戳,便于后续整理会议纪要、生成字幕或做语音分析。

【适合谁】如果您是内容创作者(播客/视频字幕制作)、学术研究者(访谈录音转文字)、视频剪辑师、翻译人员、学生(课堂录音整理)或任何需要频繁处理音频转文字且注重隐私的用户,这个 Skill 将大幅提升您的效率。

【使用建议】建议在配备独立显卡(NVIDIA GPU,至少 4GB 显存)的电脑上运行以获得最佳速度;CPU 也可运行但较慢。支持单个大文件(数小时)和批量文件夹处理。注意:本 Skill 只处理音频文件,如果您提供视频或图片,不会触发任何操作。如果您需要将视频中的音频提取出来,请先使用其他工具分离音频轨道。

核心特点

与市面上常见的云端语音转文字服务不同,本 Skill 完全在本地运行,数据不出设备,隐私零风险;同时针对中文长音频做了深度优化,采用 Faster-Whisper large-v3-ct2 模型,内置 VAD 分段,输出结构化文本+时间戳,特别适合会议、访谈、视频字幕等中文场景。

注意事项

仅处理音频文件(wav/mp3/m4a 等),不支持视频、图片、纯文本;处理速度受本地硬件(尤其是 GPU)影响,CPU 模式较慢。

常见问题

支持哪些音频格式?

支持 wav、mp3、m4a 等常见格式,以及整个音频文件夹批量处理。

需要联网吗?

首次使用需要下载模型(约2-3GB),之后完全离线运行,无需联网。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/turbo-whisper-local-stt-x/raw/index.md 读取 turbo-whisper-local-stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。