turbo-whisper-local-stt

本地高性能、隐私安全的音频转文字工具

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:turbo-whisper-local-stt。
它的用途是:本地高性能、隐私安全的音频转文字工具
完整的 Skill 内容见:https://321skill.com/skills/turbo-whisper-local-stt-x-6/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

‘帮我把这个会议录音文件夹里的内容转成文字,并标出时间点。’ 它会自动识别文件夹内的音频文件,使用本地模型进行转录,最终输出一份包含完整文本、分段和对应时间戳的文档,方便你快速整理会议纪要或定位关键发言。

介绍

这个技能解决了用户对音频内容进行文字转录的需求,特别是当用户需要处理会议录音、访谈内容、语音笔记或为视频生成字幕时。它能够将常见的音频格式(如wav、mp3、m4a)或整个文件夹的音频文件,快速、准确地转换为结构化的文本。

使用时,用户只需将音频文件或包含音频文件的文件夹提供给AI助手,并表达转录意图,技能便会自动触发。它会在本地运行,利用Faster-Whisper模型进行处理,输出包含完整文本、分段信息以及时间戳的结构化结果,方便后续编辑和使用。

该技能特别适合内容创作者、学术研究者、会议记录者、视频剪辑师以及任何需要处理大量中文语音材料,且对隐私安全和离线处理有要求的用户。内置的语音活动检测(VAD)功能使其能够智能处理长时间录音,自动分段,提升长音频转录的准确性和可读性。

需要注意的是,本技能仅能处理音频文件或音频文件夹,对于视频、图片或纯文本文件不会触发。建议在处理前确保音频文件清晰,无明显背景噪音,以获得更佳的转录效果。对于超大型音频文件,处理时间可能较长,请耐心等待。

核心特点

核心区别在于完全离线运行,保障隐私安全,并针对中文场景和长音频进行了优化(内置VAD分段),输出结果为带时间戳的结构化文本,而非单一文本流。

注意事项

仅能处理音频文件或文件夹,无法直接处理视频文件或图片中的音频。

常见问题

支持哪些音频格式?

支持 wav、mp3、m4a 等常见音频格式。

转录速度如何?能处理多长的音频?

基于本地Faster-Whisper模型,性能较高,特别适合长音频,内置VAD可自动分段处理。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/turbo-whisper-local-stt-x-6/raw/index.md 读取 turbo-whisper-local-stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。