Dlazy Elevenlabs Stt

支持自动语言检测和说话人分离的高质量语音转文字工具。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Dlazy Elevenlabs Stt。
它的用途是:支持自动语言检测和说话人分离的高质量语音转文字工具。
完整的 Skill 内容见:https://321skill.com/skills/dlazy-elevenlabs-stt-x-5/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“请将‘meeting_recording.mp3’这段会议录音转换成文字,并区分开每个发言的人。”,它会调用 ElevenLabs 的 STT 服务,自动检测语言,进行说话人分离,最终生成一份带有时间戳和说话人标签(如‘Speaker A:’)的完整文字记录,方便您快速整理会议要点和行动项。

介绍

本工具旨在解决音频内容高效、准确地转化为结构化文字的问题。它基于 ElevenLabs 的 scribe_v1 模型,能够自动识别音频中的语言,并可选地将不同说话人的语音进行区分(说话人分离),从而将会议录音、访谈、播客或视频中的语音内容快速生成文字稿。

使用时,您只需提供音频文件路径,工具便会调用 ElevenLabs 的 API 进行处理。您可以根据需要开启或关闭说话人分离功能,处理完成后会获得包含时间戳和说话人标签(如开启)的文本文件,格式清晰,便于后续编辑。

它非常适合需要处理大量音频转录工作的内容创作者、学术研究者、项目经理以及客服人员。无论是制作视频字幕、整理会议纪要,还是分析访谈内容,都能显著提升效率。

建议在使用前确保音频质量清晰,以获得最佳识别效果。由于依赖外部 API,请合理规划使用量以控制成本,并注意处理包含隐私或敏感信息的音频时需遵守相关规定。

核心特点

核心区别在于集成了 ElevenLabs 业界领先的 scribe_v1 模型,在语音识别准确度和多语言支持上表现优异,并且原生提供了可选的说话人分离功能,无需额外集成其他工具即可区分对话中的不同角色。

注意事项

不适合处理背景噪音过大、多人同时说话重叠严重或音频质量极差的录音场景。

常见问题

支持哪些语言?

支持多种语言,并能自动检测音频中的语言类型。

说话人分离准确吗?

在对话清晰、说话人音色差异明显的场景下准确度较高,但对于音色相近或多人快速交替的对话可能存在误差。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/dlazy-elevenlabs-stt-x-5/raw/index.md 读取 Dlazy Elevenlabs Stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。