Wan 参考生视频
提交一个异步 Ali wan2.7-r2v 视频生成任务。
该能力使用顶层 media 数组作为公开多模态输入。当前支持的 media.type 包括 reference_image、reference_video 和 first_frame。
当前公开规则:
prompt为必填;- 至少提供一个
reference_image或reference_video; reference_image与reference_video合计最多 5 个;first_frame为可选,最多 1 个;size仅支持720P和1080P;ratio仅支持16:9、9:16、1:1、4:3、3:4;seconds仅接受2到15的整数字符串;若包含任意reference_video,则允许范围收窄为2到10。
当提供多个参考素材时,请在提示词中按提交顺序引用:图片参考写作 图1、图2,视频参考写作 视频1、视频2,图像和视频分别计数。
授权
在请求头中传入 Authorization: Bearer <token>。
请求体
模型名称。可选值:wan2.7-r2v。
wan2.7-r2v 文本提示词。用来描述生成视频中期望包含的元素和视觉特点。
支持中英文,每个汉字、字母、标点占一个字符,超过部分会自动截断。
wan2.7-r2v:不超过5000个字符。
参考指代: 当为中文提示词时,参考图片时通过"图1、图2"这类标识指代,参考视频时通过"视频1、视频2"这类标识指代。英文提示词则写为"Image 1"、"Video 1"这类标识。英文字母和数字之间有空格,首字母大写。顺序与 media 数组顺序一致。图和视频分别计数,即同时存在图1、视频1等标识。若参考素材有且仅有一张图片或一个视频,则可简化表述为"参考图片"或"参考视频"。
画面描述: 假设参考图1是一只猫,图2是一个房间,要描述猫在房间里玩耍,支持两种写法:一种是直接使用标识指代(如"图1在图2里玩耍");另一种是结合主体与场景补充说明(如"图1的猫在图2的房间里玩耍")。
多宫格(故事板图像): 当参考图片为多宫格(故事板图像)时,提示词建议按照多分镜的形式描述画面内容。无需描述每个宫格,提供关键分镜内容即可,模型将自动识别宫格逻辑并智能补全镜头内容。为达到更好的效果,建议单次仅输入一张多宫格图。
媒体素材数组,素材包括图像、视频和音频。支持图像/视频输入作为视觉参考,图像支持多视图,常见参考角色、道具、场景等。
数组中每个元素为一个媒体对象,包含 type 与 url 字段。
按照数组顺序定义 prompt 中角色引用的顺序。图和视频分别计数,即可同时存在图1、视频1。
- 数组中的第 1 个
reference_video对应 视频1,第 2 个对应 视频2,以此类推。 - 数组中的第 1 个
reference_image对应 图1,第 2 个对应 图2,以此类推。
重要
size 直接影响费用,请在调用前确认模型价格。
生成视频的分辨率档位,用于控制视频的清晰度(总像素)。
wan2.7-r2v:可选值:720P、1080P。默认值为 1080P。
720P, 1080P 重要
seconds 直接影响费用,请在调用前确认模型价格。
生成视频的时长,单位为秒。
wan2.7-r2v:默认值为 5。
- 当参考素材中包含视频时:取值为 [2, 10] 之间的整数。
- 当参考素材中不包含视频时:取值为 [2, 15] 之间的整数。
2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15 生成视频的宽高比。
生效逻辑:
- 未传入首帧图像:按指定的
ratio参数生成视频。 - 已传入首帧图像:自动忽略
ratio参数,以首帧图像的宽高比生成近似比例的视频。
可选值为:
16:9(默认值)9:161:14:33:4
不同宽高比对应的输出视频分辨率(宽高像素值):
720P:
16:9→ 1280×7209:16→ 720×12801:1→ 960×9604:3→ 1104×8323:4→ 832×1104
1080P:
16:9→ 1920×10809:16→ 1080×19201:1→ 1440×14404:3→ 1648×12483:4→ 1248×1648
16:9, 9:16, 1:1, 4:3, 3:4 反向提示词,用来描述不希望在视频画面中出现的内容,可以对视频画面进行限制。
支持中英文,长度不超过500个字符,超过部分会自动截断。
示例值:低分辨率、错误、最差质量、低质量、残缺、多余的手指、比例不良等。
是否开启 prompt 智能改写。开启后使用大模型对输入 prompt 进行智能改写。对于较短的 prompt 生成效果提升明显,但会增加耗时。
true:默认值,开启智能改写。false:不开启智能改写。
是否添加水印标识,水印位于视频右下角,文案固定为 "AI生成"。
false:默认值,不添加水印。true:添加水印。
随机数种子,取值范围为 [0, 2147483647]。
未指定时,系统自动生成随机种子。若需提升生成结果的可复现性,建议固定 seed 值。 请注意,由于模型生成具有概率性,即使使用相同 seed,也不能保证每次生成结果完全一致。
0 <= x <= 2147483647