turbo-whisper-local-stt

本地高性能中文音频转文字,离线隐私安全

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:turbo-whisper-local-stt。
它的用途是:本地高性能中文音频转文字,离线隐私安全
完整的 Skill 内容见:https://321skill.com/skills/turbo-whisper-local-stt-x-7/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“请把这段会议录音转成文字,并标注每个人说话的时间段”,它会调用本地Whisper模型处理音频,输出完整文本、分段内容以及每个发言片段的时间戳,方便你直接生成会议纪要。

对AI说:“批量转录这个文件夹里所有的mp3录音”,它会自动遍历文件夹内的音频文件,逐一处理并返回合并或单独的结构化转录结果。

介绍

你是否经常需要把会议录音、访谈音频、语音笔记或视频中的对话转成文字?传统在线转录服务不仅依赖网络,还可能涉及隐私泄露风险。本 Skill 基于 Faster-Whisper(large-v3-ct2 等模型)在本地完成音频转文字,完全离线运行,确保数据安全。它内置 VAD 语音活动检测,自动将长音频分段,输出带时间戳的完整文本和分段结果,中文识别效果优先优化。

使用非常简单:直接提供音频文件(支持 wav/mp3/m4a 等常见格式)或包含音频文件的文件夹,Skill 会自动识别并触发转录。你无需配置复杂参数,只要说出“把这段录音转成文字”或“转录这个文件夹里的音频”,它就会开始处理。处理完成后,你会得到结构化结果,包括完整的全文、按语义分段的内容以及每个片段的起止时间戳,方便后续编辑或生成字幕。

本 Skill 特别适合需要频繁处理中文音频的用户,比如内容创作者(录制播客、采访)、学术研究者(访谈录音整理)、视频剪辑师(提取字幕)以及需要本地隐私保护的商务人士。如果你经常参加长会议、需要整理会议纪要,或者想从大量录音中快速提取文字信息,这个工具能大幅提升效率。

使用建议:为确保最佳效果,建议音频质量清晰、背景噪音较少;对于极长音频(数小时),VAD 分段可能会消耗一定时间,但整体准确率会更高。注意本 Skill 仅处理音频文件,如果你有视频文件,需要先提取音频轨道再使用。另外,首次运行会自动下载模型(约 2-3GB),请确保有足够磁盘空间和网络用于模型下载,后续完全离线。

核心特点

使用 Faster-Whisper large-v3-ct2 模型,内置 VAD 分段,特别适合长音频和中文场景,输出结构化文本+分段+时间戳,完全离线保障隐私。

注意事项

仅处理音频文件(wav/mp3/m4a)或音频文件夹,不支持视频、图片或纯文本文件。

常见问题

支持哪些音频格式?

支持 wav、mp3、m4a 等常见格式,以及整个音频文件夹批量处理。

需要联网吗?

首次运行需联网下载模型文件,后续完全离线,隐私安全。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/turbo-whisper-local-stt-x-7/raw/index.md 读取 turbo-whisper-local-stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。