Dlazy Elevenlabs Stt
一款支持自动语言检测和说话人分离的语音转文字工具。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Dlazy Elevenlabs Stt。 它的用途是:一款支持自动语言检测和说话人分离的语音转文字工具。 完整的 Skill 内容见:https://321skill.com/skills/dlazy-elevenlabs-stt-x-4/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“请将我上传的这段团队会议录音转换成文字,并区分出不同发言人的内容。”,它会调用该Skill处理音频,自动检测语言并尝试分离说话人,最终输出一份带发言人标记的完整文字稿,方便你快速整理会议纪要和行动项。
介绍
这个Skill基于ElevenLabs的scribe_v1模型,旨在高效准确地将音频内容转换为文字。它解决了手动转录耗时耗力、多语言或多人对话场景下转录困难的问题,适用于需要快速获取文字记录的各种场景。
使用时,您只需提供音频文件或音频流,该Skill便能自动识别音频中的语言,并可选地将不同说话人的内容区分开来,生成结构化的文字稿。整个过程无需手动干预语言设置或说话人标记。
它非常适合内容创作者、学术研究者、项目经理、客服人员以及任何需要处理会议录音、访谈、播客、视频字幕或生成会议纪要的用户。对于需要分析音频内容或进行多语言内容本地化的团队也很有帮助。
建议在使用前确保音频质量清晰,以获得最佳识别效果。对于包含大量专业术语或背景噪音严重的音频,可能需要后期进行人工校对。该服务依赖ElevenLabs的API,请注意相关的使用配额和成本。
核心特点
核心区别在于集成了ElevenLabs先进的自动语言检测和可选的说话人分离(声纹识别)功能,无需预先指定语言或手动标记说话人切换,在转录多语言会议或多人访谈时尤其高效。
注意事项
对于音频质量极差、口音过重或说话人频繁快速交替的极端场景,识别准确率可能会下降。
常见问题
支持哪些语言?
支持ElevenLabs scribe_v1模型覆盖的多种语言,并能自动检测。
说话人分离准确吗?
在音频清晰、说话人音色区分度高的场景下效果良好,但对于音色相近或多人同时说话的情况可能有限制。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/dlazy-elevenlabs-stt-x-4/raw/index.md 读取 Dlazy Elevenlabs Stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/dlazy-elevenlabs-stt-x-4/raw/index.md(查看排版版本)