Dlazy Elevenlabs Stt
一款集成了 ElevenLabs scribe_v1 模型的语音转文字工具,支持多语言识别和说话人分离。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Dlazy Elevenlabs Stt。 它的用途是:一款集成了 ElevenLabs scribe_v1 模型的语音转文字工具,支持多语言识别和说话人分离。 完整的 Skill 内容见:https://321skill.com/skills/dlazy-elevenlabs-stt-x-7/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
‘请帮我把这个会议录音文件转换成文字,并区分开王总和李经理的发言。’,它会调用该Skill处理音频,生成一份带有说话人标签的完整文字记录。或者
对AI说:‘我需要为这段产品宣传视频生成中文字幕。’,它会自动识别视频中的语音并输出时间轴对齐的字幕文件。
介绍
Dlazy Elevenlabs Stt 是一个专注于将音频内容高效、准确地转换为文字的工具。它解决了用户在会议记录、视频字幕制作、采访转录等场景下,手动整理录音耗时耗力的问题,通过自动化流程提升内容处理效率。
使用时,用户只需提供音频文件,该工具便会调用 ElevenLabs 先进的 scribe_v1 模型进行语音识别。其核心功能包括自动检测音频语言,并可选地开启说话人分离(Speaker Diarization),从而在多人对话场景下区分不同发言者的内容,生成结构清晰的文字稿。
它非常适合需要处理大量音频素材的内容创作者、进行会议记录和纪要整理的行政或项目人员、以及需要为视频添加字幕的媒体工作者。对于学术研究者整理访谈录音,或客服团队分析通话记录,同样能提供有力支持。
建议在使用前确保音频质量清晰,以获得最佳识别效果。对于包含专业术语或特定口音的音频,可考虑在转录后进行人工校对。请注意,其识别准确度依赖于 ElevenLabs 的云端模型能力。
核心特点
核心在于集成了 ElevenLabs 专有的 scribe_v1 模型,在语音识别准确度和多语言支持上可能优于通用开源方案;同时,其可选的说话人分离功能,能自动区分对话中的不同角色,特别适合会议、访谈等多说话人场景的转录。
注意事项
不适合处理背景噪音过大、音频质量极差或包含大量非标准发音/生僻专业术语的音频文件。
常见问题
支持哪些语言的语音转写?
支持自动语言检测,可处理多种主流语言,具体范围取决于 ElevenLabs scribe_v1 模型的能力。
说话人分离功能准确吗?
在音频清晰、说话人音色区分度高的场景下效果较好,但对于音色相近或多人快速交叉对话的情况,可能需要人工辅助校正。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/dlazy-elevenlabs-stt-x-7/raw/index.md 读取 Dlazy Elevenlabs Stt 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/dlazy-elevenlabs-stt-x-7/raw/index.md(查看排版版本)