faster-whisper

基于本地GPU加速的音频转录工具,速度比原版Whisper快4-6倍。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:faster-whisper。
它的用途是:基于本地GPU加速的音频转录工具,速度比原版Whisper快4-6倍。
完整的 Skill 内容见:https://321skill.com/skills/faster-whisper/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“请用faster-whisper转录我桌面上的 interview.mp3 文件,并生成带说话人标签的SRT字幕。” 它会调用该技能,快速完成音频转录,并输出一个包含时间戳和说话人标识(如“Speaker A:”)的字幕文件。或者你可以说:“转录这个YouTube视频链接,并翻译成英文。” 它会自动下载视频音频,完成转录和翻译。

介绍

faster-whisper 是一个解决音频、视频文件本地转录和字幕生成问题的技能。它基于 CTranslate2 重新实现了 OpenAI 的 Whisper 模型,能够在保持相同准确率的前提下,将转录速度提升4-6倍,结合GPU加速甚至能达到约20倍实时速度,极大提升了处理长音频文件的效率。

使用方式非常灵活,你可以直接提供本地音频/视频文件路径,也可以输入 YouTube 链接或 RSS 播客订阅源让它自动抓取并转录。它支持批量处理文件夹,并会显示预估完成时间。通过简单的命令参数,你可以选择输出 SRT、VTT、CSV 等多种格式的字幕,开启说话人分离(区分不同讲话者),或者将非英语内容翻译成英文。

这个技能非常适合内容创作者(如播客主、视频UP主)、研究人员、记者、学生以及任何需要将会议录音、访谈、讲座或在线视频内容快速转换为文字稿和字幕的用户。它完全在本地运行,无需联网调用API,保护了隐私也节省了成本。

与同类基于云端API的转录服务或原版Whisper相比,faster-whisper 的核心优势在于其极致的速度与本地化。它通过底层模型优化实现了数倍的性能飞跃,并且提供了原版Whisper所没有的丰富功能,如说话人分离、章节检测、字幕格式批量导出等,形成了一个功能全面、高效易用的本地转录工作站。

核心特点

核心区别在于:1) 通过 CTranslate2 底层优化,在完全相同的模型精度下,转录速度比原版 OpenAI Whisper 快4-6倍;2) 集成了说话人分离、章节检测、多格式字幕导出等高级功能于一体,而许多同类工具功能单一。

注意事项

不适合需要实时流式转录(如直播字幕)的场景,主要针对文件或URL的事后处理。

常见问题

faster-whisper转录准确吗?

准确率与OpenAI原版Whisper模型完全相同,但速度更快。

支持中文转录吗?

支持,可自动检测或指定中文,并支持将中文翻译成英文。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/faster-whisper/raw/index.md 读取 faster-whisper 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。