Dlazy Fun Asr
基于阿里云FunASR的录音转写工具,支持多语言及说话人分离。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Dlazy Fun Asr。 它的用途是:基于阿里云FunASR的录音转写工具,支持多语言及说话人分离。 完整的 Skill 内容见:https://321skill.com/skills/dlazy-fun-asr-x-2/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请帮我把这个会议录音文件转写成文字,并区分一下是谁说的。',它会调用Dlazy Fun Asr技能,处理你提供的音频文件,返回一份带有说话人标签和时间戳的完整转录文本,方便你快速整理会议纪要。
介绍
Dlazy Fun Asr Skill 旨在解决用户在会议记录、内容创作、学习研究等场景下,需要将音频内容快速、准确地转换为文字并区分不同说话人的问题。它集成了阿里云百炼FunASR模型,能够自动识别音频中的语言,并支持说话人分离,将转写结果以结构化的文本形式输出。
使用时,用户只需提供音频文件路径或URL,该Skill便会调用FunASR服务进行语音识别。它支持中文、英文等多种语言,并自动检测语言种类。同时,其说话人分离功能可以将不同发言者的内容区分开来,方便后续整理。整个过程无需复杂的参数配置,即可获得带时间戳和说话人标签的转录文本。
该Skill非常适合内容创作者、学术研究者、客服人员、项目经理等需要处理大量音频材料的角色。无论是整理访谈录音、制作视频字幕,还是复盘会议内容,都能显著提升效率。
使用建议:为确保最佳识别效果,请尽量提供清晰、背景噪音少的音频文件。由于依赖云端服务,需要稳定的网络连接。对于超长音频,建议分段处理以避免超时。同时,请注意保护音频中可能涉及的隐私信息。
核心特点
核心区别在于集成了阿里云百炼的FunASR模型,在中文场景下识别准确率较高,且原生支持说话人分离功能,无需额外配置即可区分不同发言者。
注意事项
不适合处理实时流式音频或对识别延迟要求极高的场景,且识别效果受音频质量和网络状况影响较大。
常见问题
支持哪些音频格式?
支持常见的WAV、MP3、AAC等格式,具体可参考FunASR官方文档。
说话人分离准确吗?
在对话清晰、说话人音色差异明显的场景下效果较好,但对于多人快速交叉对话或音色相近的情况可能有限制。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/dlazy-fun-asr-x-2/raw/index.md 读取 Dlazy Fun Asr 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/dlazy-fun-asr-x-2/raw/index.md(查看排版版本)