Dlazy Videoretalk
通义视频唇同步配音模型
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Dlazy Videoretalk。 它的用途是:通义视频唇同步配音模型 完整的 Skill 内容见:https://321skill.com/skills/dlazy-videoretalk-x-5/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请帮我将这段产品介绍视频配上法语配音,并同步唇形。' 它会先提取视频中的人物面部,再根据法语音频逐帧调整嘴唇运动,最终输出一段口型与法语完全匹配的新视频,方便多语言市场推广。
介绍
Dlazy Videoretalk 是一个基于通义千问的视频唇同步模型,解决视频配音时口型与音频不匹配的问题。只需输入一段人物说话的视频和一段音频,模型会自动分析视频中人物的唇部运动,并重新生成视频,使得嘴唇动作与输入音频完美同步,实现自然的配音效果。
使用非常简单:将说话人物视频和需要配音的音频文件上传至模型,系统会自动完成唇形识别、音频对齐和视频渲染,无需手动调整关键帧或逐帧编辑。整个过程由AI自动完成,大幅降低视频配音的制作门槛。
该模型特别适合内容创作者、视频剪辑师和营销专员使用。无论是制作宣传短片、社媒视频还是创意视频,都能快速为已有视频素材替换或新增配音,尤其适用于多语言本地化、视频配音翻新、自动生成口播视频等场景。
使用时建议提供清晰正面人脸的视频,光照均匀、嘴唇区域无遮挡效果最佳;音频质量需保持干净,避免背景噪音干扰。模型对多人同框或侧面角度的人脸支持有限,建议单人正面镜头使用。
核心特点
与同类唇同步模型相比,Dlazy Videoretalk 基于通义千问大模型,唇形拟合更加自然,支持多语言音频输入,无需额外训练即可直接使用。
注意事项
不适合多人同框、侧面/遮挡人脸或带夸张表情的视频场景,对极低分辨率或严重压缩的视频效果不佳。
常见问题
支持哪些语言的音频输入?
支持中文、英文等多种语言的音频,模型根据音频内容自动匹配唇形,不依赖语言本身。
需要GPU吗?运行速度如何?
建议使用GPU加速,处理一段30秒视频大约需要1-3分钟,具体取决于视频分辨率和时长。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/dlazy-videoretalk-x-5/raw/index.md 读取 Dlazy Videoretalk 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/dlazy-videoretalk-x-5/raw/index.md(查看排版版本)