Dlazy Jimeng Omnihuman 1.5

用照片和音频生成数字人播报视频

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Dlazy Jimeng Omnihuman 1.5。
它的用途是:用照片和音频生成数字人播报视频
完整的 Skill 内容见:https://321skill.com/skills/dlazy-jimeng-omnihuman-1-5-x-2/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

‘使用这张照片和这段文本,生成一个数字人播报视频,内容为产品功能介绍。’ 它会调用即梦 OmniHuman 1.5 模型,将照片中的人物转化为数字人,并自动匹配文本进行口型同步播报,输出一段逼真的宣传视频。

介绍

你是否需要快速制作数字人广播视频,但缺乏专业设备或真人出镜条件?本 Skill 基于即梦(Jimeng)OmniHuman 1.5 模型,只需一张人像照片和一段音频或文本,就能生成逼真的数字人播报视频,口型同步自然,适合用于产品宣传、课程讲解、社媒内容等场景,大幅降低视频制作门槛。

使用非常简单:上传一张正面清晰的人像图片,提供音频文件或直接输入文字,AI 会自动调用 OmniHuman 1.5 模型,将图片中的静态人物转化为动态数字人,并匹配音频/文本内容进行播报。整个过程无需训练模型或手动调整关键帧,几分钟内即可输出成品视频。

本 Skill 尤其适合内容创作者、营销专员、视频剪辑师、教育工作者等,需要频繁制作视频但缺乏真人出镜资源的人群。无论是制作社交媒体短视频、产品演示、课程讲解,还是生成虚拟主播,都能快速上手。

建议使用高清、正面、无遮挡的人像照片,音频背景噪音尽量小,以确保口型同步和视频质量。对于复杂肢体动作或多人场景,本 Skill 效果有限,更适合半身或头部特写的播报场景。

核心特点

与同类数字人生成工具相比,本 Skill 直接调用即梦 OmniHuman 1.5 模型,无需本地部署或训练,从单张图片和音频/文本即可秒级生成视频,口型同步和面部表情自然度更高。

注意事项

不适合需要完整肢体动作、多人互动或复杂背景的视频场景,对照片清晰度和音频质量有一定要求。

常见问题

需要什么输入?

一张人像照片(正面、清晰)和一段音频或文本内容,AI 会自动生成数字人播报视频。

支持哪些语言?

模型支持多种语言,但中文和英文效果最佳,其他语言需测试。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/dlazy-jimeng-omnihuman-1-5-x-2/raw/index.md 读取 Dlazy Jimeng Omnihuman 1.5 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。