Dlazy Videoretalk

基于通义VideoRetalk的AI视频口型同步与配音工具

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Dlazy Videoretalk。
它的用途是:基于通义VideoRetalk的AI视频口型同步与配音工具
完整的 Skill 内容见:https://321skill.com/skills/dlazy-videoretalk/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

‘帮我把这个中文产品介绍视频,配上这段英文解说音频,生成一个口型同步的英文版视频。’ 它会调用Dlazy Videoretalk技能,处理你提供的视频和音频文件,最终输出一个口型与英文解说完美匹配的新视频文件。

介绍

Dlazy Videoretalk是一个利用通义VideoRetalk模型实现的视频口型同步工具。它能将一段包含人物说话的视频与一段新的音频(如配音、翻译后的语音)相结合,通过AI技术重新生成视频,使视频中人物的口型与新的音频完美匹配,实现逼真的配音或语言替换效果。

使用时,用户需要准备原始的人物说话视频文件和目标音频文件。通过运行该Skill提供的脚本或命令,模型会自动分析视频中的人脸、口型以及音频的节奏和音素,然后生成一个口型与音频同步的新视频文件。整个过程自动化,无需复杂的手动关键帧调整。

该Skill非常适合视频剪辑师、内容创作者、营销专员以及需要进行视频本地化(如多语言配音)的团队。对于制作多语言宣传片、教育视频、社交媒体内容或为已有视频更换旁白等场景,它能显著提升效率。

建议在使用前确保原始视频中人物面部清晰、光线良好,且音频质量较高,以获得最佳的口型同步效果。由于涉及AI模型推理,生成过程可能需要一定的计算资源和时间,建议在性能足够的机器上运行。

核心特点

该Skill直接集成了阿里云通义实验室的VideoRetalk模型,专注于高质量、高准确度的视频口型同步生成,相比一些通用的视频处理工具,在口型与语音的时序匹配上更为精准和自然。

注意事项

不适合处理面部遮挡严重、多人同时说话或非真人(如卡通角色)的视频口型同步。

常见问题

支持哪些视频和音频格式?

通常支持常见的视频格式(如MP4、AVI)和音频格式(如WAV、MP3),具体取决于底层模型的输入要求。

生成一个视频需要多长时间?

时间取决于视频长度、分辨率和硬件性能,通常需要数分钟到数十分钟不等。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/dlazy-videoretalk/raw/index.md 读取 Dlazy Videoretalk 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。