Dlazy Fun Asr
阿里云FunASR语音转写,支持多语言及说话人分离
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Dlazy Fun Asr。 它的用途是:阿里云FunASR语音转写,支持多语言及说话人分离 完整的 Skill 内容见:https://321skill.com/skills/dlazy-fun-asr-x-5/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
‘请将`meeting_audio.mp3`这个会议录音文件转写成文字,并区分出不同发言人的内容。’,它会调用FunASR服务处理音频,返回一份带说话人标签和时间戳的完整文字稿。你也可以说:‘分析这段产品访谈录音,提取出客户提到的主要痛点。’,它会先转录,然后你可以基于文本进一步分析。
介绍
该Skill解决了在会议记录、访谈整理、内容创作等场景下,需要将音频快速、准确地转换为文字并区分不同说话人的问题。它集成了阿里云百炼FunASR模型,能够自动检测语言(支持中英文等),并识别音频中的不同说话人,生成带时间戳和说话人标签的转录文本。
使用时,您只需提供音频文件路径或URL,Skill便会调用云端服务进行处理。它适用于处理多种格式的音频,并能有效应对带有背景噪音或多人对话的复杂场景。
该Skill非常适合需要处理大量音频素材的内容创作者、进行访谈或会议记录的学术研究者与项目经理,以及任何需要将语音内容快速文本化的专业人士。它能够显著提升信息整理和内容生产的效率。
建议在使用前确保音频文件清晰,对于过长的音频可考虑分段处理以获得更佳效果。请注意,该Skill依赖于阿里云的服务,需要有效的API密钥和网络连接,并可能产生相应的服务调用费用。
核心特点
核心区别在于集成了阿里云百炼的FunASR模型,不仅提供高精度的语音转写,还内置了自动语言检测和说话人分离(声纹识别)功能,能自动区分音频中的不同讲话者,无需额外配置或调用其他工具。
注意事项
不适合处理实时流式音频转录或对延迟要求极高的场景,且需要网络连接和阿里云API密钥。
常见问题
支持哪些音频格式?
支持常见的WAV、MP3、M4A等格式,具体可参考FunASR官方文档。
转写准确率如何?
基于阿里云百炼的FunASR模型,在清晰普通话和英语上准确率较高,嘈杂环境或口音较重可能影响效果。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/dlazy-fun-asr-x-5/raw/index.md 读取 Dlazy Fun Asr 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/dlazy-fun-asr-x-5/raw/index.md(查看排版版本)