Dlazy Elevenlabs Stt

ElevenLabs语音转文字,支持自动语言检测与说话人分离

效率工具 内容创作者视频剪辑师翻译人员 语音转写文字提取视频字幕 通用 ★ 1.3k 更新于 2026-08-01

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Dlazy Elevenlabs Stt。
它的用途是:ElevenLabs语音转文字,支持自动语言检测与说话人分离
完整的 Skill 内容见:https://321skill.com/skills/dlazy-elevenlabs-stt-x-6/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'将这段会议录音转写成文字,并启用说话人分离,标记每个人说的话。' 它会调用ElevenLabs STT,自动检测语言,输出带时间戳和说话人标签的逐句文本,可直接用于会议纪要整理或字幕制作。

介绍

该技能基于ElevenLabs的scribe_v1模型,提供高精度的语音转文字服务。它能自动检测输入音频的语言,无需手动指定,并可选开启说话人分离(Speaker Diarization),自动区分不同说话人。适用于会议记录、视频字幕生成、访谈转录、课堂笔记等场景,尤其适合多语言或多人对话的音频处理。

使用方式简单:在AI对话中上传音频文件或提供音频链接,指定是否启用说话人分离,即可获得带时间戳的转录文本。支持常见音频格式,输出为结构化文本,可进一步导出为SRT、TXT等格式。无需复杂配置,开箱即用。

适合内容创作者、视频剪辑师、翻译人员、学术研究者、项目经理等需要高效处理音频转文字的用户。例如,自媒体博主可将访谈录音快速转成字幕稿,学生可将课堂录音转成笔记,记者可将采访录音转写为文字素材。

建议注意:该技能依赖ElevenLabs API,需确保网络连接稳定并拥有有效API密钥。对于超长音频(如数小时会议),建议分段处理以控制Token消耗。不支持实时流式转录,适合离线批量处理。说话人分离功能在嘈杂环境下可能效果下降,建议使用清晰录音。

核心特点

相比其他STT技能,它直接集成ElevenLabs scribe_v1模型,自动语言检测覆盖多种语言,且说话人分离无需额外标注,适合多语言、多说话人的复杂场景。

注意事项

不适合实时低延迟场景(如直播字幕),且对极度嘈杂或多人重叠说话的音频效果有限。

常见问题

支持哪些语言?

支持数十种常见语言,包括中文、英文、日文、韩文、西班牙语、法语等,自动检测无需手动选择。

需要API密钥吗?

需要,首次使用需配置ElevenLabs的API密钥,可在设置中填入。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/dlazy-elevenlabs-stt-x-6/raw/index.md 读取 Dlazy Elevenlabs Stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。