Dlazy Fun Asr

基于阿里云FunASR的录音转写工具,支持多语言及说话人分离。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Dlazy Fun Asr。
它的用途是:基于阿里云FunASR的录音转写工具,支持多语言及说话人分离。
完整的 Skill 内容见:https://321skill.com/skills/dlazy-fun-asr-x-2/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请帮我把这个会议录音文件转写成文字,并区分一下是谁说的。',它会调用Dlazy Fun Asr技能,处理你提供的音频文件,返回一份带有说话人标签和时间戳的完整转录文本,方便你快速整理会议纪要。

介绍

Dlazy Fun Asr Skill 旨在解决用户在会议记录、内容创作、学习研究等场景下,需要将音频内容快速、准确地转换为文字并区分不同说话人的问题。它集成了阿里云百炼FunASR模型,能够自动识别音频中的语言,并支持说话人分离,将转写结果以结构化的文本形式输出。

使用时,用户只需提供音频文件路径或URL,该Skill便会调用FunASR服务进行语音识别。它支持中文、英文等多种语言,并自动检测语言种类。同时,其说话人分离功能可以将不同发言者的内容区分开来,方便后续整理。整个过程无需复杂的参数配置,即可获得带时间戳和说话人标签的转录文本。

该Skill非常适合内容创作者、学术研究者、客服人员、项目经理等需要处理大量音频材料的角色。无论是整理访谈录音、制作视频字幕,还是复盘会议内容,都能显著提升效率。

使用建议:为确保最佳识别效果,请尽量提供清晰、背景噪音少的音频文件。由于依赖云端服务,需要稳定的网络连接。对于超长音频,建议分段处理以避免超时。同时,请注意保护音频中可能涉及的隐私信息。

核心特点

核心区别在于集成了阿里云百炼的FunASR模型,在中文场景下识别准确率较高,且原生支持说话人分离功能,无需额外配置即可区分不同发言者。

注意事项

不适合处理实时流式音频或对识别延迟要求极高的场景,且识别效果受音频质量和网络状况影响较大。

常见问题

支持哪些音频格式?

支持常见的WAV、MP3、AAC等格式,具体可参考FunASR官方文档。

说话人分离准确吗?

在对话清晰、说话人音色差异明显的场景下效果较好,但对于多人快速交叉对话或音色相近的情况可能有限制。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/dlazy-fun-asr-x-2/raw/index.md 读取 Dlazy Fun Asr 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。