Dlazy Fun Asr

阿里云百炼Fun-ASR录音转写,支持多语言与说话人分离

数据分析 内容创作者学术研究者视频剪辑师 语音转写文字 通用 ★ 1.2k 更新于 2026-08-01

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Dlazy Fun Asr。
它的用途是:阿里云百炼Fun-ASR录音转写,支持多语言与说话人分离
完整的 Skill 内容见:https://321skill.com/skills/dlazy-fun-asr-x-7/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请将这份会议录音转写成文字,区分每个说话人并标注时间戳。' 它会自动下载录音文件,调用Fun-ASR进行语音识别,输出带说话人标签的文本,如'[00:01-00:15] 张三:大家好,今天讨论...'。也可要求导出为SRT字幕格式用于视频后期。

介绍

该技能解决的是将录音文件高效转写为文字的问题,尤其适用于会议记录、访谈整理、课程笔记等场景。它基于阿里云百炼Fun-ASR模型,能够自动识别音频中的语言种类(中文、英文等),并区分不同说话人,输出带时间戳的结构化文本,大幅减少人工听写的耗时。

使用方法简单:只需提供音频文件路径或URL,AI会调用Fun-ASR进行处理,返回转写结果。支持常见的音频格式(如MP3、WAV、M4A),并自动进行语言检测和说话人分类。处理完成后,可导出为文本或SRT字幕格式。

适合需要频繁处理录音的用户,如内容创作者(播客、视频字幕)、学术研究者(访谈转写)、视频剪辑师(素材整理)、翻译人员(多语言录音转写)等。无需复杂配置,开箱即用。

注意事项:该技能为离线处理,不支持实时流式语音识别;处理时长受限于音频长度和模型计算资源,较长音频可能需要等待;说话人分离效果取决于录音质量(多麦克风、安静环境更佳)。建议在录音时尽量保持清晰、避免多人同时说话。

核心特点

相比通用ASR工具,该技能基于阿里云百炼Fun-ASR,内置说话人分离和自动语言检测,无需额外配置,且对中文、英文的识别准确率更高,特别适合双语混杂的会议录音。

注意事项

不适用于实时流式语音识别场景,且对嘈杂环境或多人同时说话的情况识别准确率会下降。

常见问题

支持哪些音频格式?

支持MP3、WAV、M4A、FLAC等常见格式,建议采样率16kHz以上。

说话人分离准确吗?

在多说话人且录音清晰的情况下,分离效果较好;若两人同时说话或背景噪音大,可能误判。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/dlazy-fun-asr-x-7/raw/index.md 读取 Dlazy Fun Asr 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。