Dlazy Elevenlabs Stt

一款支持自动语言检测和说话人分离的语音转文字工具。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Dlazy Elevenlabs Stt。
它的用途是:一款支持自动语言检测和说话人分离的语音转文字工具。
完整的 Skill 内容见:https://321skill.com/skills/dlazy-elevenlabs-stt-x-4/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“请将我上传的这段团队会议录音转换成文字,并区分出不同发言人的内容。”,它会调用该Skill处理音频,自动检测语言并尝试分离说话人,最终输出一份带发言人标记的完整文字稿,方便你快速整理会议纪要和行动项。

介绍

这个Skill基于ElevenLabs的scribe_v1模型,旨在高效准确地将音频内容转换为文字。它解决了手动转录耗时耗力、多语言或多人对话场景下转录困难的问题,适用于需要快速获取文字记录的各种场景。

使用时,您只需提供音频文件或音频流,该Skill便能自动识别音频中的语言,并可选地将不同说话人的内容区分开来,生成结构化的文字稿。整个过程无需手动干预语言设置或说话人标记。

它非常适合内容创作者、学术研究者、项目经理、客服人员以及任何需要处理会议录音、访谈、播客、视频字幕或生成会议纪要的用户。对于需要分析音频内容或进行多语言内容本地化的团队也很有帮助。

建议在使用前确保音频质量清晰,以获得最佳识别效果。对于包含大量专业术语或背景噪音严重的音频,可能需要后期进行人工校对。该服务依赖ElevenLabs的API,请注意相关的使用配额和成本。

核心特点

核心区别在于集成了ElevenLabs先进的自动语言检测和可选的说话人分离(声纹识别)功能,无需预先指定语言或手动标记说话人切换,在转录多语言会议或多人访谈时尤其高效。

注意事项

对于音频质量极差、口音过重或说话人频繁快速交替的极端场景,识别准确率可能会下降。

常见问题

支持哪些语言?

支持ElevenLabs scribe_v1模型覆盖的多种语言,并能自动检测。

说话人分离准确吗?

在音频清晰、说话人音色区分度高的场景下效果良好,但对于音色相近或多人同时说话的情况可能有限制。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/dlazy-elevenlabs-stt-x-4/raw/index.md 读取 Dlazy Elevenlabs Stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。