万相3.0 视频生成
提交一个异步的阿里云万相3.0视频生成任务。支持文生视频、图生视频(首帧/首尾帧)和参考生视频等多种用法。
该能力使用顶层 media 数组作为多模态输入。通过不同的 media.type 组合实现不同能力:
- 文生视频:仅传入
prompt,不传media。 - 首帧生视频:传入
first_frame类型媒体。 - 首尾帧生视频:同时传入
first_frame和last_frame类型媒体。 - 参考生视频:传入
reference_image、reference_video或reference_audio类型媒体。
注意:reference_xx / file / link 类型和 first_frame / last_frame 类型互斥,不能在同一请求中混用。
提交任务后,请通过 GET /v1/videos/{task_id} 查询任务状态。
授权
在请求头中传入 Authorization: Bearer <token>。
请求体
模型名称。可选值:
wan3.0-video:标准版。wan3.0-video-prime:高速版,能力对齐标准版,端到端速度显著提升。
wan3.0-video, wan3.0-video-prime 文本提示词,用来描述期望生成的视频内容。与 media 必填其一。
支持中英文,每个汉字/字母占一个字符,不超过20000个字符,超过部分会自动截断。
在全能参考模式下,prompt 中可以用 图1、视频1 等指代 media 数组中对应顺序的媒体素材。
媒体素材数组,支持图像、视频、音频、文件和网页作为输入。与 prompt 必填其一。
-
数组中每个元素为一个媒体对象,包含
type与url字段。 -
在参考生视频下,按照数组书序定义prompt中素材引用的书序。图和视频分别计数,即可同时存在图1、视频1。
-
数组中的第 1 个
reference_image对应 图1,第 2 个对应 图2,以此类推。 -
数组中的第 1 个
reference_video对应 视频1,第 2 个对应 视频2,以此类推。 -
数组中的第 1 个
reference_audio对应 音频1,第 2 个对应 音频2,以此类推。
重要
size 直接影响费用,请在调用前确认模型价格。
生成视频的分辨率档位。默认值为 1080P。
480P, 720P, 1080P 生成视频的宽高比。默认值为 adaptive(自适应长宽比,根据输入媒体比例和意图自动推荐合适的长宽比)。
可选值为:
adaptive(默认值):自适应长宽比。16:94:31:13:49:16
adaptive, 16:9, 4:3, 1:1, 3:4, 9:16 重要
seconds 直接影响费用,请在调用前确认模型价格。
生成视频的时长,单位为秒。默认值为 5。
- 无视频输入时:取值范围为 [2, 30] 之间的整数。
- 有视频输入时:输入视频总时长 + 输出视频时长不超过30秒。
- 传
-1时:智能时长模式,模型根据输入的 prompt、内容和富媒体自动推荐合适时长。
-1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23, 24, 25, 26, 27, 28, 29, 30 输出视频是否包含音频。
true(默认值):输出视频包含声音。false:输出视频不包含音轨。
开关声音价格相同。
是否开启 prompt 智能改写。开启后使用大模型对输入 prompt 进行智能改写。对于较短的 prompt 生成效果提升明显,但会增加耗时。
true(默认值):开启智能改写。false:不开启智能改写。
是否添加水印标识,水印位于视频右下角,文案固定为 "AI生成"。
false(默认值):不添加水印。true:添加水印。
随机数种子,取值范围为 [0, 2147483647]。
未指定时,系统自动生成随机种子。若需提升生成结果的可复现性,建议固定 seed 值。请注意,由于模型生成具有概率性,即使使用相同 seed,也不能保证每次生成结果完全一致。
0 <= x <= 2147483647