Dlazy Videoretalk

基于通义VideoRetalk模型,实现视频人物口型与音频同步

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Dlazy Videoretalk。
它的用途是:基于通义VideoRetalk模型,实现视频人物口型与音频同步
完整的 Skill 内容见:https://321skill.com/skills/dlazy-videoretalk-x/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

‘帮我把这个中文产品介绍视频,配上我新录制的英文解说音频,生成口型同步的新版本。’ 它会调用Dlazy Videoretalk技能,处理你提供的视频和音频文件,最终输出一个口型与英文解说完美匹配的宣传视频。

介绍

Dlazy Videoretalk 是一个专门用于视频口型同步(Lip Sync)的AI工具。它解决了在视频配音、多语言内容制作或内容再创作时,人物口型与音频不匹配的难题,能够生成自然流畅、口型精准同步的新视频。

使用时,用户只需提供一个包含说话人物的原始视频文件和一个新的音频文件(如配音、翻译后的音频或修改后的旁白),该工具便会利用通义的VideoRetalk模型,自动分析并重新生成视频中人物的嘴部动作,使其与新音频完美匹配。

该工具非常适合视频剪辑师、内容创作者、营销专员以及需要进行视频本地化(如多语言配音)的团队使用。它能够显著提升视频制作的效率和专业度,尤其适用于制作宣传短片、教育内容或多语言社媒视频。

建议在使用前确保原始视频中人物面部清晰、光线良好,且新音频的语速和节奏与原视频大致相当,以获得最佳效果。由于是AI生成,对于极端表情或快速说话的片段,可能需要手动微调或选择其他片段。

核心特点

核心区别在于其专门针对通义VideoRetalk模型进行了封装和优化,提供了更便捷的调用方式,并且专注于解决视频口型同步这一单一但高频的需求,而非提供泛化的视频编辑功能。

注意事项

不适合处理面部严重遮挡、侧脸或画质极差的原始视频,也无法处理非人声(如纯音乐)的音频同步。

常见问题

支持哪些视频和音频格式?

通常支持常见的MP4、MOV等视频格式和MP3、WAV等音频格式,具体需查看仓库文档。

处理一段视频需要多长时间?

处理时间取决于视频长度、分辨率和硬件性能,通常需要数分钟到数十分钟不等。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/dlazy-videoretalk-x/raw/index.md 读取 Dlazy Videoretalk 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。