Dlazy Videoretalk
基于通义VideoRetalk模型的AI视频口型同步工具
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Dlazy Videoretalk。 它的用途是:基于通义VideoRetalk模型的AI视频口型同步工具 完整的 Skill 内容见:https://321skill.com/skills/dlazy-videoretalk-x-3/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
‘帮我把这个中文产品介绍视频,用我提供的英文配音音频进行口型同步,生成一个英文版的宣传片。’,它会调用Dlazy Videoretalk技能,处理你上传的视频和音频文件,最终输出一个口型与英文配音完美匹配的新视频。或者
对AI说:‘我有一段采访视频,但现场收音不好,我想替换成清晰的录音并让口型对上。’,它同样可以完成音频替换与口型重绘的工作。
介绍
Dlazy Videoretalk Skill 是一个专门用于视频口型同步(对口型)的AI工具。它解决了传统视频配音或换音时,人物口型与音频不匹配的难题,能够根据输入的讲话者视频和新的音频轨道,自动生成口型与声音完美同步的新视频。
使用时,用户只需提供一个包含人物讲话的视频文件和一个新的音频文件(如配音、翻译后的音频),该Skill便会调用底层的通义VideoRetalk模型进行处理。模型会分析视频中人物的面部动作,特别是嘴部区域,然后根据新音频的节奏和内容,重新渲染视频画面,使人物看起来像是在说新音频的内容,最终输出一个口型同步的视频。
这个Skill非常适合视频剪辑师、内容创作者、营销专员等需要制作多语言视频、进行视频二次创作或修复配音口型问题的用户。无论是为教育视频添加外语配音,还是为营销短片更换更合适的旁白,它都能显著提升视频的专业度和观感。
使用建议方面,为了获得最佳效果,建议输入的视频人物面部清晰、光线良好,且讲话镜头稳定。新的音频文件应尽量清晰,无明显背景噪音。需要注意的是,该模型主要针对讲话口型,对于大幅度的头部转动或遮挡,效果可能会打折扣。处理时间取决于视频长度和分辨率。
核心特点
该Skill直接集成了阿里通义实验室开源的VideoRetalk模型,专注于高质量、高保真的视频口型同步生成,相比一些通用视频编辑工具或简单的面部贴图方法,其生成的口型动作更为自然流畅。
注意事项
不适合处理面部严重遮挡、非正面讲话或需要同步肢体语言的复杂视频场景。
常见问题
Dlazy Videoretalk支持哪些视频和音频格式?
通常支持常见的MP4、AVI等视频格式和MP3、WAV等音频格式,具体依赖底层模型的输入要求。
处理一段5分钟的视频需要多久?
处理时间受硬件性能(如GPU)和视频分辨率影响,在性能较好的机器上可能需要数分钟到十几分钟不等。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/dlazy-videoretalk-x-3/raw/index.md 读取 Dlazy Videoretalk 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/dlazy-videoretalk-x-3/raw/index.md(查看排版版本)