Dlazy Elevenlabs Stt
ElevenLabs语音转文字,自动语言检测+说话人分离
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Dlazy Elevenlabs Stt。 它的用途是:ElevenLabs语音转文字,自动语言检测+说话人分离 完整的 Skill 内容见:https://321skill.com/skills/dlazy-elevenlabs-stt-x-3/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'将这段英文会议录音转写成文字,并开启说话人分离。' 它会调用ElevenLabs STT服务,自动检测语言为英语,识别出三位说话人,输出带时间戳的对话文本,并标注Speaker1、Speaker2等标签,方便后续整理会议纪要。
介绍
该技能利用ElevenLabs最新的scribe_v1模型,实现高精度的语音转文字功能,支持自动检测输入音频的语言,并可选开启说话人分离(Speaker Diarization)。它能够将会议录音、访谈、讲座等音频内容快速转换为结构化的文本,同时标注不同说话人,极大提升后续处理效率。适用于字幕生成、实时转录、会议记录整理等场景,尤其适合多语言混合的音频文件。
使用方式简单:在AI代理中配置好ElevenLabs的API密钥后,即可直接调用该技能。只需提供音频文件路径或URL,技能会自动完成语言检测、转录和说话人分离,最终返回带时间戳的对话文本。支持批量处理多个音频文件,也支持流式输入。输出格式可选择纯文本、SRT字幕或JSON结构化数据,方便后续集成到工作流中。
该技能特别适合内容创作者(快速生成视频字幕)、视频剪辑师(获取精确时间轴文本)、翻译人员(多语言音频的初步转写)以及学术研究者(整理访谈、讲座录音)。对于需要频繁处理多语言会议或访谈的用户,该技能能节省大量手动转写和标注时间。
使用前需确保拥有ElevenLabs的有效API密钥,并注意API调用费用(按音频时长计费)。对于噪声较大或多人同时说话的音频,说话人分离准确率可能下降,建议先清理音频或使用高质量录音。长音频建议分段处理以避免超时限制。该技能依赖网络,不可离线使用。
核心特点
与其他STT工具相比,它内置了ElevenLabs最新的scribe_v1模型,支持自动语言检测和说话人分离,无需额外配置,特别适合多语言会议和访谈场景。
注意事项
需要网络连接调用ElevenLabs API,可能需要付费API密钥,且不支持离线使用。
常见问题
支持哪些语言?
支持多种语言,包括中文、英文、日文、韩文、法文、德文等,且会自动检测输入语言。具体支持列表可参考ElevenLabs文档。
需要API密钥吗?
是的,需要注册ElevenLabs账号并获取API密钥,在技能配置中填入才能使用。免费额度有限,超出后需付费。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/dlazy-elevenlabs-stt-x-3/raw/index.md 读取 Dlazy Elevenlabs Stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/dlazy-elevenlabs-stt-x-3/raw/index.md(查看排版版本)