Dlazy Elevenlabs Stt
ElevenLabs语音转文字,支持自动语言检测和说话人区分
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Dlazy Elevenlabs Stt。 它的用途是:ElevenLabs语音转文字,支持自动语言检测和说话人区分 完整的 Skill 内容见:https://321skill.com/skills/dlazy-elevenlabs-stt/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请将这段会议录音转写成文字,并启用说话人区分,最后生成会议纪要摘要。' 它会自动检测音频语言(如中英混合),调用ElevenLabs scribe_v1模型逐句转写,为每个说话人分配编号,输出带时间戳的逐字稿,并自动提炼关键讨论点和待办事项。
介绍
该技能基于ElevenLabs最新scribe_v1模型,提供高精度的语音转文字服务。解决多语言会议记录、视频字幕制作、采访稿整理等场景中手动听写效率低、语言识别不准的问题。支持自动检测音频中的语言(无需手动指定),并可选择启用说话人分离(Speaker Diarization),自动区分不同说话人,生成带时间戳和说话人标签的逐字稿。
使用方式简单:向AI提供音频文件路径或URL,AI会自动调用ElevenLabs模型进行转写,返回结构化文本结果。你也可以指定输出格式(如纯文本、SRT字幕、VTT字幕等),或要求AI直接生成会议纪要摘要。无需复杂配置,即装即用。
适合内容创作者(快速生成视频字幕)、视频剪辑师(批量处理转录素材)、客服人员(整理电话录音)、学术研究者(转写访谈录音)、翻译人员(多语言字幕校对)等需要频繁处理音频转文字的用户。尤其适合需要处理多语言混用或多人对话场景的团队。
使用建议:音频文件时长建议控制在10分钟以内以保证处理速度;说话人分离功能在录音清晰、说话人间隔明显时效果最佳;避免在嘈杂环境录音中使用;如需高实时性流式转写,请考虑其他专用方案。
核心特点
与通用语音转文字工具相比,本技能直接集成ElevenLabs scribe_v1模型,自动语言检测无需手动切换,且说话人分离准确率更高,特别适合多语言混合会议和多人对话场景。
注意事项
不支持实时流式转写,仅支持音频文件上传处理;极长音频(超过1小时)可能需分片处理。
常见问题
支持哪些语言?
支持ElevenLabs scribe_v1模型涵盖的所有语言,包括英语、中文、日语、韩语、法语、德语、西班牙语等主流语言,并自动检测。
说话人区分功能怎么用?
在调用时设置参数enable_diarization=true,转写结果会为每段话标注说话人编号(如Speaker 1、Speaker 2),适合会议记录。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/dlazy-elevenlabs-stt/raw/index.md 读取 Dlazy Elevenlabs Stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/dlazy-elevenlabs-stt/raw/index.md(查看排版版本)