Dlazy Fun Asr
基于阿里云FunASR的录音转文字工具,支持多语言和说话人分离。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Dlazy Fun Asr。 它的用途是:基于阿里云FunASR的录音转文字工具,支持多语言和说话人分离。 完整的 Skill 内容见:https://321skill.com/skills/dlazy-fun-asr-x-6/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
‘请将`meeting.mp3`这段会议录音转写成文字,并区分出每个发言的人。’ 它会调用Fun-ASR服务处理音频,返回一份带有说话人标签(如Speaker A、Speaker B)和对应时间戳的完整文字稿。你也可以指定输出格式,例如纯文本或带标记的文档。
介绍
Dlazy Fun Asr 主要解决音频内容(如会议录音、访谈、课程)快速、准确转写成文字的问题。它集成了阿里云百炼Fun-ASR模型,能够自动识别音频中的语言(支持中英文等),并区分不同说话人,将音频高效转化为结构化的文本。
使用时,您只需提供音频文件路径或URL,该Skill便会调用Fun-ASR服务进行识别,返回包含时间戳和说话人标签的转录文本。整个过程通过简单的命令或API调用即可完成,无需复杂的本地模型部署。
该Skill非常适合需要处理大量音频素材的内容创作者、进行访谈或会议记录整理的分析师与项目经理,以及需要将课程录音转为文字的高校学生和研究者。它能够显著提升从音频中提取信息的效率。
建议在使用前确保音频文件清晰、背景噪音较小,以获得最佳识别效果。对于包含专业术语或特定口音的音频,可考虑在转录后进行人工校对。同时,请注意Fun-ASR服务可能有调用配额或费用,使用前请了解相关服务条款。
核心特点
核心区别在于集成了阿里云官方的Fun-ASR模型,在中文场景下识别准确率较高,且原生支持说话人分离功能,无需额外配置即可区分对话中的不同角色。
注意事项
不适合处理背景噪音过大、多人同时说话或包含大量生僻专业术语的音频。
常见问题
支持哪些音频格式?
支持常见的WAV、MP3、AAC等格式。
说话人分离准确吗?
在对话清晰、说话人音色差异明显的场景下效果较好,但极度嘈杂或音色相近时可能出错。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/dlazy-fun-asr-x-6/raw/index.md 读取 Dlazy Fun Asr 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/dlazy-fun-asr-x-6/raw/index.md(查看排版版本)