Dlazy Fun Asr
阿里通义Fun-ASR录音转写,支持多语言与说话人分离。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Dlazy Fun Asr。 它的用途是:阿里通义Fun-ASR录音转写,支持多语言与说话人分离。 完整的 Skill 内容见:https://321skill.com/skills/dlazy-fun-asr-x-3/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'将这份会议录音转写成文字,并标记每个说话人。' 它会自动处理录音文件,输出带时间戳和说话人标签的完整文本,方便后续整理会议纪要或翻译。
介绍
该Skill基于阿里云通义Fun-ASR模型,解决用户将录音文件转写成文字的需求,特别适合多语言场景(如中英文混合)和需要区分不同说话人的会议、采访等场景。它自动检测音频语言,并输出带有说话人标签的转写文本,大幅提升信息整理效率。
使用方式简单:安装后,通过AI助手直接上传或指定录音文件路径,Skill会自动调用Fun-ASR引擎完成转写,返回结构化文本。用户无需手动配置语言参数或后处理说话人分离,整个过程一键完成。
适合内容创作者、翻译人员、高校学生等需要频繁处理录音的用户。例如,整理会议纪要、翻译采访记录、制作课堂笔记等,都能显著节省时间。
使用建议:确保录音清晰,避免背景噪音过高;支持常见音频格式(如MP3、WAV、M4A);对于超长录音(>2小时),建议分段处理以获得更好的转写质量。注意,该Skill仅支持离线录音文件,不适用于实时流式转写。
核心特点
相比通用的Whisper等语音转写方案,该Skill深度集成阿里云Fun-ASR,对中文和英文的识别准确率更高,且内置说话人分离功能,无需额外配置或模型下载。
注意事项
不适合实时流式语音转写,且对极高噪声环境或超长录音(>3小时)的转写效果可能下降。
常见问题
支持哪些语言?
支持中文、英文、中英文混合,以及日、韩、法、德等常见语言,自动检测语言类型。
支持哪些音频格式?
支持MP3、WAV、M4A、FLAC等常见格式,建议采样率16kHz以上。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/dlazy-fun-asr-x-3/raw/index.md 读取 Dlazy Fun Asr 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/dlazy-fun-asr-x-3/raw/index.md(查看排版版本)