audio-transcriber

支持多说话人识别与LLM润色的音频转录Claude插件

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:audio-transcriber。
它的用途是:支持多说话人识别与LLM润色的音频转录Claude插件
完整的 Skill 内容见:https://321skill.com/skills/audio-transcriber/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“请使用Audio Transcriber插件处理我上传的团队周会录音,并区分出每位发言者。” 插件会自动调用后台引擎,将一小时的会议音频转换为带人名标签的文本初稿。接着,你可以要求AI:“用Claude模型对这份转录稿进行润色,去掉‘嗯’、‘啊’等语气词,并修正明显的识别错误。” 最终你将得到一份清晰、可直接分发的会议纪要。

介绍

Audio Transcriber 是一个专为会议、播客等多人对话场景设计的音频转录Claude插件。它能将音频文件自动转换为带说话人标签的文本,并利用大语言模型进行润色,解决传统转录工具难以区分不同发言者、处理口语化表达和长录音的问题。

使用方式非常灵活。你可以通过 skills.sh 命令行或 Claude Code 插件市场快速安装。使用时,只需提供音频文件(建议转换为16kHz单声道FLAC格式),插件便会调用其集成的两种ASR引擎(FunASR或MiMo-V2.5-ASR)进行语音识别和说话人分离,并可选择通过LLM(如Claude)对原始转录文本进行清理,去除语气词、修正错误、优化语法。

该工具非常适合需要高效整理会议纪要、访谈记录、播客文稿的团队和个人,如项目经理、内容创作者、研究人员和远程办公者。它尤其擅长处理包含多名参与者、专业术语或中英文混杂的复杂对话场景。

与同类转录工具相比,Audio Transcriber的核心优势在于其深度集成的“说话人分离”和“LLM后处理”能力。它不仅准确识别谁在何时说话,还能智能地优化转录文本的可读性,而许多工具仅提供原始的、未经整理的识别结果。

核心特点

核心区别在于同时集成了自动说话人分离(Diarization)和可选的LLM文本清理流程,能直接产出带说话人标签、语法通顺的会议文稿,而非原始的、未经整理的识别文本。此外,它支持两种高性能ASR引擎(FunASR和MiMo),可根据对专有名词识别、语种混合等不同需求灵活选择。

注意事项

MiMo-V2.5-ASR引擎需要至少20GB的GPU显存,对硬件要求较高;对于超大型会议(如数十人),说话人分离的准确性可能下降。

常见问题

支持哪些语言和方言?

支持中文(普通话)、英语、日语、韩语、粤语等99种语言,以及中文与方言、中英文的混合语音识别。

能处理多长的录音?

可以处理长达6小时以上的录音,无需预先分割,并支持断点续传。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/audio-transcriber/raw/index.md 读取 audio-transcriber 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。