Dlazy Elevenlabs Stt
基于ElevenLabs的语音转文字,支持自动语言检测和说话人分离。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Dlazy Elevenlabs Stt。 它的用途是:基于ElevenLabs的语音转文字,支持自动语言检测和说话人分离。 完整的 Skill 内容见:https://321skill.com/skills/dlazy-elevenlabs-stt-x-2/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请转录这段英语-中文混合的会议录音,并启用说话人分离,输出带时间戳的SRT字幕。' 它会自动检测音频中的语言,识别不同发言者,生成包含说话人标签和准确时间码的字幕文件,可直接用于视频编辑或会议纪要整理。
介绍
该技能解决的是多语言、多说话人场景下的语音转文字痛点。无论是会议录音、视频字幕还是采访整理,手动转写耗时且易出错,而 ElevenLabs scribe_v1 模型能自动识别语言并区分说话人,大幅提升转录效率。
使用方式非常直接:将音频文件或链接传入,技能会调用 ElevenLabs API 自动完成转写。输出包含时间戳、说话人标签和置信度分数,可直接用于字幕制作或会议纪要生成。你只需提供音频源,无需额外配置。
适合视频剪辑师、内容创作者、学术研究者、社媒运营等需要频繁处理语音内容的用户。尤其适合跨国团队会议记录、多语言视频字幕制作、以及需要区分不同发言人的讲座或采访场景。
建议使用时确保音频质量清晰,背景噪音较小。由于依赖云端 API,需注意网络连接和 API 调用配额。对于实时性要求极高的场景(如直播字幕),建议考虑专用流式解决方案。
核心特点
与普通语音转文字工具相比,该技能内置 ElevenLabs 最新的 scribe_v1 模型,支持自动语言检测(无需手动指定语种)和可选的说话人分离(Diarization),能直接输出多人对话的逐字稿,特别适合多语言会议和访谈场景。
注意事项
不适合需要低延迟实时转写的场景(如直播字幕),且依赖 ElevenLabs API,需网络连接和 API 密钥。
常见问题
支持哪些语言?
ElevenLabs scribe_v1 支持多种主流语言,包括中、英、日、韩、法、德、西等,具体列表可参考 ElevenLabs 官方文档。
需要 API 密钥吗?
是的,需要先注册 ElevenLabs 账号获取 API 密钥,并在使用前配置环境变量或直接传入。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/dlazy-elevenlabs-stt-x-2/raw/index.md 读取 Dlazy Elevenlabs Stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/dlazy-elevenlabs-stt-x-2/raw/index.md(查看排版版本)