turbo-whisper-local-stt

本地高性能音频转文字,完全离线,专注中文场景。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:turbo-whisper-local-stt。
它的用途是:本地高性能音频转文字,完全离线,专注中文场景。
完整的 Skill 内容见:https://321skill.com/skills/turbo-whisper-local-stt-x-2/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

‘帮我把这个会议录音转成文字’,它会自动识别您提供的音频文件,使用本地模型进行转录,并输出带时间戳的完整文本和分段内容。或者说:‘这个文件夹里都是访谈录音,请帮我转成文本’,它会批量处理整个文件夹内的所有音频文件。

介绍

当您需要将音频文件转换为文字时,例如处理会议录音、访谈内容、语音笔记或为视频生成字幕,这个技能可以自动触发。它解决了在需要隐私保护或网络不便环境下,高效、准确完成语音转文字的需求。

使用时,您只需将音频文件(如wav, mp3, m4a)或包含音频文件的文件夹提供给AI,技能便会自动调用本地Faster-Whisper模型进行处理。整个过程无需联网,直接在您的设备上运行。

该技能特别适合内容创作者、学术研究者、项目经理、客服人员以及任何需要处理大量中文音频转录任务的用户。对于涉及敏感信息的会议、访谈,或对转录速度和准确性有较高要求的场景尤为合适。

请注意,本技能仅能处理音频文件或音频文件夹。如果您提供的是视频、图片或纯文本文件,它将不会被触发。对于超长音频,技能内置的VAD(语音活动检测)功能会自动进行分段处理,以获得更好的转录效果。

核心特点

核心区别在于完全离线运行,使用本地Faster-Whisper模型,确保数据隐私绝对安全;并且针对中文场景和长音频进行了专门优化,内置VAD分段,输出带时间戳的结构化文本。

注意事项

仅支持音频文件转写,无法直接处理视频文件中的音频或进行实时语音识别。

常见问题

支持哪些音频格式?

支持常见的wav、mp3、m4a等格式。

转写长音频效果如何?

内置VAD自动分段,适合处理会议、访谈等长音频,输出带时间戳的完整和分段文本。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/turbo-whisper-local-stt-x-2/raw/index.md 读取 turbo-whisper-local-stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。