turbo-whisper-local-stt
本地高性能、中文优先的音频转文字工具,完全离线运行。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:turbo-whisper-local-stt。 它的用途是:本地高性能、中文优先的音频转文字工具,完全离线运行。 完整的 Skill 内容见:https://321skill.com/skills/turbo-whisper-local-stt-x-5/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
‘帮我把这个采访录音文件夹里的内容都转成带时间戳的文字稿’,它会自动识别文件夹内的所有音频文件,使用本地模型进行转录,并生成一份包含完整文本、分段内容和对应时间戳的结构化文档。
介绍
本技能旨在解决用户在需要将音频内容转换为文字时,对隐私安全、离线可用性以及中文转录准确性的需求。无论是会议录音、访谈内容、语音笔记还是视频字幕生成,用户都无需将敏感音频数据上传至云端,即可在本地设备上快速获得准确的文字转录。
使用时,用户只需将音频文件(如wav, mp3, m4a)或包含音频文件的文件夹提供给AI助手,并表达转录需求(例如“帮我把这段录音转成文字”),技能便会自动触发。它利用本地的Faster-Whisper模型进行处理,自动对长音频进行智能分段,并输出带有时间戳的结构化文本结果。
该技能特别适合对数据隐私有严格要求、网络环境受限或经常处理中文音频内容的用户群体,例如内容创作者、学术研究者、项目经理、法务人员以及需要整理会议纪要的各类职场人士。
建议用户在处理前确保音频文件清晰、无明显背景噪音,以获得最佳转录效果。对于极长的音频文件,处理时间可能相应增加,请保持耐心。本技能仅处理音频文件,视频文件需先提取音频后再使用。
核心特点
核心区别在于完全离线运行,保障隐私安全,并针对中文场景和长音频(内置VAD分段)进行了专门优化,输出带时间戳的结构化文本,而非单纯的纯文本流。
注意事项
仅支持音频文件或文件夹,无法直接处理视频、图片或纯文本文件。
常见问题
支持哪些音频格式?
支持常见的wav、mp3、m4a等音频格式。
转录长音频效果如何?
内置VAD语音活动检测,能自动将长音频智能分段,提升长音频转录的准确性和可读性。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/turbo-whisper-local-stt-x-5/raw/index.md 读取 turbo-whisper-local-stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/turbo-whisper-local-stt-x-5/raw/index.md(查看排版版本)