通义万相:阿里自研视觉生成模型,文生图到文生视频全覆盖
国内的 AI 视觉生成模型里,通义万相是绕不开的一个。它是阿里巴巴通义实验室自研的视觉生成大模型,官网页面上给自己的定位是「领先的 AI 视频与图像生成模型」,由阿里云提供支持。目前官网首页主推的版本是万相 3.0——一个把文生视频、图生视频、全模态参考和视频编辑都收进同一套模型里的 All-in-One 方案。
一次生成 30 秒,还带声音
阿里云帮助中心的官方文档写明,万相 3.0 系列是 All-in-One 视频生成模型,在有声视频生成、多模态参考和视频编辑能力上全面升级:单次生成时长最长 30 秒、输出帧率 30fps,并原生输出台词、BGM 和音效。这几个数字放在一起,意味着「先出画面、再找人配音、最后对轨」的老流程可以省掉大半。
文生视频只要给提示词,不需要传任何素材文件。官方文档写明它原生支持最长 30 秒的多镜头叙事,会自动生成同步的台词、BGM 与音效;同时支持单镜头和多镜头分镜格式,每个镜头 4~6 秒并带时间戳标注。分辨率可选 480P / 720P / 1080P,时长 2~30 秒,另外还有一个「智能时长」——把时长参数设为自动,模型自己判断该给多长。

参考能力:图、视频、音频,连文档都能喂
这是万相 3.0 很值得单说的一块。官方文档写明,它单次支持最多 20 个多模态素材参考,涵盖图片、视频、音频、文档与网页。具体到各类:图片最多 10 张、单张不超过 20MB;视频最多 5 段、总时长不超过 15 秒;音频最多 5 段、总时长不超过 15 秒;三类参考素材还可以任意组合,比如图片加视频、图片加音频、图片加视频加音频。
更少见的是文件与网页参考。把素材类型设为「文件」或「链接」(二选一,各限 1 个),就能让它解析文档或网页内容来生成视频——一份产品手册、企划文档或数据表格,可以直接变成片子的结构与风格引导。官网也写明,万相 3.0 最高支持 20 个素材参考生成,支持复杂文档和网页解析。

首尾帧与视频编辑:控制权交回给你
图生视频部分支持首帧生视频和首尾帧生视频:通过首帧、尾帧两张图严格指定视频的开头或结尾画面,像素级还原参考画面,中间的运动交给模型补。首尾帧模式下,模型会自动生成中间的过渡动作——比只丢一句提示词更接近你脑子里那条片子。
官方文档还写明 Wan3.0 支持视频编辑与视频延长。编辑时把素材类型设为参考视频、并让提示词带上编辑意图(比如「编辑视频」「去掉」「替换」「改成」),就能做增删改元素、风格转换、光线编辑和台词编辑;延长则支持向前、向后和双向。换句话说,生成完不满意的地方可以直接在同一套模型里改,还能接着往下拍。
图像侧:文生图、多图融合与主体一致性
虽然视频是主场,万相在图像上并不弱。官网把它定义为「视频与图像生成模型」,图像侧支持文生图与图生图,能力包括多图融合与创意重组、商用级主体一致性保持、美学要素迁移,以及镜头和光线的精准控制;还能做图文混排输出,让多张图片和文字一起生成,适合绘本、信息图表这类需要逻辑排版的场景。写实人像也是它明确在做的方向,官方强调会综合优化构图与光影,削弱常见的「AI 感」。
模型家族与怎么用
通义实验室的官方发布页写明,通义万相 Wan 模型家族已支持文生图、文生视频、图生视频、人声生视频和动作生成等 10 多种视觉创作能力,累计生成 3.9 亿张图片、7000 万个视频;此外已连续开源 20 多款模型,在开源社区和三方平台的下载量超过 3000 万。日常使用上,万相官网可以直接体验,也能通过阿里云百炼平台调用 API 做批量生产。
也要说清的边界
官方文档里有几处限制值得先知道:文档与网页链接仅支持无需登录的公开页面,非公开内容喂不进去;参考素材有上限,图片 10 张、视频与音频各 5 段且各不超过 15 秒;首尾帧模式与参考素材的类型不能混用,比如首尾帧只能传首帧和尾帧,不能再同时塞音频参考。这些不是坑,是选型前就该算进去的约束。
一句话概括:万相 3.0 补的是「一条片子从脚本到成片要跨好几个工具」这件事——30 秒、有声、多镜头、可参考、可编辑,官方都放进了同一套模型里。如果你在做短剧、广告或电商视频,它值得排进试用清单;如果只是偶尔生成一张图,图像侧的文生图入口也就够了。