Dlazy Fun Asr

阿里云百炼Fun-ASR录音转写,支持多语言与说话人分离

效率工具 内容创作者高校学生翻译人员 语音转写文字提取视频字幕 通用 ★ 1.2k 更新于 2026-07-31

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Dlazy Fun Asr。
它的用途是:阿里云百炼Fun-ASR录音转写,支持多语言与说话人分离
完整的 Skill 内容见:https://321skill.com/skills/dlazy-fun-asr-x/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请将这段英文会议录音转写成文字,并标注每位发言人的姓名和说话时间。' 技能会自动检测英语,分离不同说话人,输出带时间戳的转写结果,如'[00:00:00] 张三: Hello, everyone. [00:00:05] 李四: Good morning.' 你还可以指定输出格式(JSON/纯文本)或要求翻译成中文。

介绍

该技能基于阿里云百炼的Fun-ASR模型,专注于将录音文件转写为文字,并自动识别语种、分离不同说话人。它能够处理中文、英文等多种语言的长音频,输出带时间戳和说话人标签的文本,大幅提升会议记录、采访整理、视频字幕生成等场景的效率。

使用方式简单:安装后,通过上传音频文件或提供音频URL,调用技能即可获得转写结果。技能会自动检测音频中的语言,并尝试区分不同说话人,无需手动配置语言或说话人数量。支持常见音频格式(如MP3、WAV、M4A等),输出为结构化的JSON或纯文本。

适合内容创作者(如播客制作、采访整理)、高校学生(课堂录音转笔记)、翻译人员(多语言会议记录)、以及需要处理大量语音数据的职场人士。尤其适合需要快速获取精确文字稿并区分发言人的场景,如法庭记录、客户访谈、学术研讨会等。

建议使用时注意音频质量:清晰、无背景噪音的录音效果最佳;超过1小时的超长音频可能需分段处理。该技能依赖阿里云百炼API,需提前配置有效的API密钥。此外,请注意保护录音中的个人隐私信息,避免上传敏感数据。

核心特点

相比于通用的Whisper或语音识别SDK,该技能直接集成了阿里云百炼的Fun-ASR模型,开箱即用,且内置自动语言检测和说话人分离功能,无需额外配置模型或训练。

注意事项

不适合需要实时流式语音转写或低延迟场景(如实时会议字幕),且依赖阿里云百炼API,需网络连接和有效密钥。

常见问题

如何安装这个技能?

可以通过npm全局安装:npm install -g dlazy-fun-asr,或从Git仓库克隆后手动安装。

支持哪些音频格式?

支持MP3、WAV、M4A、FLAC等常见格式,建议采样率16kHz以上。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/dlazy-fun-asr-x/raw/index.md 读取 Dlazy Fun Asr 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。