图片 + 音频生成高表现力数字人视频
上传一张图片、一段语音或音乐,并可选加入提示词,即可生成具备口型同步、情绪动作、肢体表现和镜头控制的口播或演唱视频。
预览 OmniHuman 效果,并一键回填输入。
Make her sing confidently into a microphone with natural lip sync
用 OmniHuman 1.5 从少量输入生成数字人、角色表演、AI 音乐视频、营销短片和剧情化短视频。
用一张参考图片和一个音频文件生成 MP4 数字人视频。图片越清晰、音频越干净,生成结果通常越稳定。
语音、歌声、节奏和情绪可以驱动口型、表情、停顿、手势和身体动作,而不只是简单移动嘴部。
通过提示词描述动作顺序、镜头运动、焦点变化、环境互动或画面中需要补充的细节。
可以使用真人、宠物、动漫角色或多主体画面。如果需要指定某个角色说话,可先做主体检测并添加指定说话主体。
准备清晰素材、按需指定说话主体,再用简洁提示词控制表演。
选择 10MB 以内的 JPG、PNG 或 WebP 图片。建议使用主体清晰、面部细节可见的图片;多人画面可配合指定说话主体。
上传 10MB 以内的 MP3、WAV、AAC、OGG 或 MP4 音频。音频必须短于 60 秒,建议不超过 15 秒;需要指定说话人时可先检测主体。
选择 720p 或 1080p,用短提示词描述手势、情绪、镜头或环境互动,提交后下载生成的 MP4 视频。