Skip to main content

即梦视频生成示例

以下示例展示如何使用即梦(Jimeng)视频生成模型通过 OpenAI 兼容接口生成高质量的视频内容。 即梦视频生成分为三个步骤:
  1. 创建视频生成任务 - 提交生成请求,获得任务ID
  2. 查询任务状态 - 定期检查任务进度
  3. 下载生成的视频 - 任务完成后下载视频文件

步骤1:创建视频生成任务

响应示例

步骤2:查询任务状态

状态响应示例

排队中:
已完成:

步骤3:下载生成的视频

完整流程示例

支持的参数

  • model: 使用的模型名称 (jimeng-video-3.0-pro、 jimeng-video-3.0-720P、 jimeng-video-3.0-1080P)
  • prompt: 视频描述文本(必需,建议400字以内)
  • req_key: 用于指定具体的即梦模型版本(必选)
    • jimeng-video-3.0-pro: jimeng_ti2v_v30_pro
    • jimeng-video-3.0-720P: jimeng_t2v_v30 (文生图), jimeng_i2v_first_v30(首帧), jimeng_i2v_first_tail_v30(首尾帧), jimeng_i2v_recamera_v30(运镜)
    • jimeng-video-3.0-1080P: jimeng_t2v_v30_1080p(文生图), jimeng_i2v_first_v30_1080(首帧), jimeng_i2v_first_tail_v30_1080(首尾帧)
  • seed: 随机种子,默认-1(随机),可指定固定值获得一致结果
  • frames: 生成的总帧数,可选值[121, 241],默认121
  • seconds: 视频时长(秒),支持5秒或10秒,系统会自动转换为对应帧数(5秒=121帧,10秒=241帧)
  • size: 视频尺寸,格式为 宽x高(如 1280x720),系统会自动转换为对应的宽高比
  • aspect_ratio: 生成视频的长宽比,默认”16:9”,支持常见比例(即梦官方参数)
  • image_urls: 参考图片URL数组
  • content: 内容数组,支持文本和图片的组合输入(平台兼容格式)

图生视频示例

除了文本到视频生成,即梦也支持从图片生成视频。以下示例展示如何使用参考图片生成视频:

图生视频示例场景

任务状态说明

  • in_queue: 任务已提交,正在排队等待处理
  • processing: 任务正在处理中
  • completed: 任务已完成,可以下载视频
  • failed: 任务失败

即梦 OmniHuman 数字人

即梦 OmniHuman 是一个数字人视频生成服务,支持通过人像图片和音频生成数字人说话视频。完整的数字人视频生成流程分为三个步骤:
  1. 主体检测(可选)- 检测图片中的主体,返回 mask 图 URL 列表
  2. 主体识别(可选)- 识别图片中是否包含人/类人/拟人主体
  3. 视频生成 - 提交数字人视频生成任务
说明
  • 主体检测和主体识别是可选步骤,用于预检查图片是否适合生成数字人视频
  • 如果图片中有多个人物,可以通过主体检测获取 mask URL,在视频生成时指定说话的主体
  • 视频生成任务复用即梦视频生成接口,任务状态查询和视频下载与普通视频生成相同

步骤1:主体检测(可选)

主体检测是一个同步接口,用于检测图片中的主体并返回对应的 mask 图 URL 列表。最多支持检测 5 个主体。

主体检测响应示例

主体检测参数说明

请求参数: 响应参数:

步骤2:主体识别(可选)

主体识别是一个异步接口,用于识别图片中是否包含人、类人、拟人等主体。

主体识别响应示例

主体识别参数说明

请求参数: 响应参数:

步骤3:数字人视频生成

数字人视频生成复用即梦视频生成接口(/v1/videos),通过 generation_type 参数设置为 "omni_human" 来触发数字人视频生成。

数字人视频生成响应示例

数字人视频生成参数说明

关于 mask 图传递方式: 除了使用 mask_urls 参数,也可以在 content 数组中添加带有 role: "mask_image" 的图片元素来传递 mask 图:

Content 数组说明

content 数组必须包含以下两种类型的元素: 图片元素(必选):
音频元素(必选):
注意事项
  • 音频时长必须小于 60 秒
  • 图片建议使用清晰的人像正面照
  • 如果图片中有多个人物,建议先调用主体检测接口获取 mask URL,然后在 mask_urls 参数中指定说话的主体

查询任务状态和下载视频

数字人视频生成任务创建后,可以使用与普通视频生成相同的接口来查询任务状态和下载视频:
  • 查询状态GET /v1/videos/{video_id}
  • 下载视频GET /v1/videos/{video_id}/content
详细用法请参考上方 步骤2:查询任务状态步骤3:下载生成的视频 部分。

完整流程示例

以下是一个完整的数字人视频生成流程示例,包括主体检测、视频生成、状态轮询和下载:

平台兼容视频接口

除了使用传统的 prompt + image_urls 格式,我们的平台还支持使用 JSON 格式的 content 字段来传递 prompt 和参考图片,这种方式更加灵活,适合程序化调用。

Content 字段结构

content 是一个数组,每个元素包含以下字段:

纯文本生成视频

使用图片 URL 作为参考帧

使用 Base64 编码的图片

Content 字段请求示例

提示
  • 使用 content 字段时,系统会自动从中提取文本作为 prompt,提取图片作为参考帧
  • seconds 参数支持 “5” 或 “10”,系统会自动转换为对应的帧数(5秒=121帧,10秒=241帧)
  • size 参数会自动转换为对应的宽高比,例如 “1280x720” 会转换为 “16:9”
  • 如果同时提供了 prompt 字段和 content 中的文本,content 中的文本会优先使用