turbo-whisper-local-stt

本地高性能、中文优先的音频转文字工具,完全离线运行。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:turbo-whisper-local-stt。
它的用途是:本地高性能、中文优先的音频转文字工具,完全离线运行。
完整的 Skill 内容见:https://321skill.com/skills/turbo-whisper-local-stt-x-5/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

‘帮我把这个采访录音文件夹里的内容都转成带时间戳的文字稿’,它会自动识别文件夹内的所有音频文件,使用本地模型进行转录,并生成一份包含完整文本、分段内容和对应时间戳的结构化文档。

介绍

本技能旨在解决用户在需要将音频内容转换为文字时,对隐私安全、离线可用性以及中文转录准确性的需求。无论是会议录音、访谈内容、语音笔记还是视频字幕生成,用户都无需将敏感音频数据上传至云端,即可在本地设备上快速获得准确的文字转录。

使用时,用户只需将音频文件(如wav, mp3, m4a)或包含音频文件的文件夹提供给AI助手,并表达转录需求(例如“帮我把这段录音转成文字”),技能便会自动触发。它利用本地的Faster-Whisper模型进行处理,自动对长音频进行智能分段,并输出带有时间戳的结构化文本结果。

该技能特别适合对数据隐私有严格要求、网络环境受限或经常处理中文音频内容的用户群体,例如内容创作者、学术研究者、项目经理、法务人员以及需要整理会议纪要的各类职场人士。

建议用户在处理前确保音频文件清晰、无明显背景噪音,以获得最佳转录效果。对于极长的音频文件,处理时间可能相应增加,请保持耐心。本技能仅处理音频文件,视频文件需先提取音频后再使用。

核心特点

核心区别在于完全离线运行,保障隐私安全,并针对中文场景和长音频(内置VAD分段)进行了专门优化,输出带时间戳的结构化文本,而非单纯的纯文本流。

注意事项

仅支持音频文件或文件夹,无法直接处理视频、图片或纯文本文件。

常见问题

支持哪些音频格式?

支持常见的wav、mp3、m4a等音频格式。

转录长音频效果如何?

内置VAD语音活动检测,能自动将长音频智能分段,提升长音频转录的准确性和可读性。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/turbo-whisper-local-stt-x-5/raw/index.md 读取 turbo-whisper-local-stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。