Vidu:Q3 支持音视频同步输出,对话、旁白、音效与音乐四类音轨一次生成
Vidu 是生数科技推出的 AI 视频生成平台,产品线分得比较清楚:一条是以 Q 系列为主的视频大模型,另一条是主打实时的 S 系列。官网首屏推的是两件事——「16 秒音画同出」与实时交互,前者对应 Vidu Q3,后者对应 Vidu S2。
Q3 的定位:为剧而生,声音和画面一起出
Vidu Q3 的产品页标题就是「Vidu Q3 AI视频模型 - 原生音频支持」,主标题写的是「Vidu Q3,为剧而生」,副标题是「一次生成完整片段」。页面对「音视频直出」的解释很具体:音频与画面同步输出,对话、旁白、音效、音乐四类音轨同步生成。也就是说,成片在一次导出里就能干净落地,不必再走「先生成画面、再单独补配音」的老流程。

16 秒一次成片,支持三语输出
时长是 Q3 另一个明确规格:单次生成即可获得完整 16 秒视频。页面给的理由是不用拼接、避免节奏断裂,让故事自然推进;常见问题里对「单次能生成多长的视频」的回答也是单次最多 16 秒。语言上,多语言输出一栏写明支持英语、日语、中文三种语言的视频输出。这两项加起来,Q3 要解决的是短叙事单元里声音、口型与语言一起对齐的问题——亮点区里还单独列了「多人对话」,支持自然的多角色对话。
面向漫剧、短剧与电影感镜头
亮点区还有一条「专业创作就绪」:面向漫剧、电影、短剧等专业叙事场景设计。常见问题里对适用人群的说法是需要连贯叙事与精准时序的创作者与团队,例如漫剧剧情、电影感镜头、短剧与叙事广告。镜头控制上,Q3 提供逐帧级的镜头语言与节奏控制,从运镜到节奏都可以指定叙事节点,让创作者更像在调度叙事,而不只是渲染画面。官网首页的影视叙事一栏把范围写得更宽:动画或真人、广告或短片,都在 16 秒音画同出的覆盖内。

S2:实时交互与实时编辑拆成两款模型
S 系列的思路与 Q 系列不同,主打边生成边输出。S2 之下有两条产品线:S2-Avatar 是实时交互模型,支持实时语音交互与复杂动作控制,可以结合参考图完成物品互动、服装更换与背景切换,数字人支持 720P+ 高清输出;相比上一代 S1,画质从 480P 升级到 720P,指令遵循能力也提升到可以用语音指令控制数字人完成跳舞这类动作。S2-Editing 是实时编辑模型,四类能力都基于参考图:按风格参考图实时渲染风格、按主体参考图实时替换人物、按背景参考图实时替换环境、按服装参考图实时生成多样穿搭。它是流式编辑,持续接收视频流并实时输出结果,中途更换参考图或切换场景都能保持连续输出,输入源支持摄像头、视频与图片三种。

如果不需要实时,S2 也提供异步路径:一张角色图加一段音频,就能生成口型与动作对齐的说话视频,也就是页面里提到的离线数字人。
API 与计费:统一积分计价
开放平台把模型分成三大系列:实时生成模型 S2、视频生成模型 Q、图像生成模型。视频生成一栏写明 Q 系列是旗舰视频大模型,长时长、高一致、大动态,文生、图生、参考生全覆盖;图像生成一栏写明文生图与参考生图支持到 4K 输出,并支持多张参考图。接入方式上,S2 通过 MaaS 平台提供,平台给出三步流程:注册并创建 API Key、发起第一个请求、轮询任务结果后拿到生成视频地址。
计费统一用积分,资源包里有一档专门的 S2 定向资源包:限时 350 元(原价 500 元)含 16000 积分,可用并发数 5、有效期 12 个月,官方估算可实时互动约 177 分钟,面向想先试新模型的用户;入门体验包 500 元含 16000 积分,适用视频、音频、图像等全类型任务。积分本身分三类:订阅积分随套餐给出、有效期 30 天;购买积分可按需增购,与活动、比赛获得的奖励积分一样,有效期 2 年。规则里还有两条值得注意:积分购买服务面向付费用户开放,订阅积分在消耗顺序上排在增购积分之前。

几点边界
其一,16 秒是单次生成的上限,也是官方主推的叙事单元长度,需要更长的成片仍要靠多段组合或后续的延长能力。其二,S2 的实时能力对网络与并发有要求,资源包明确标了可用并发数为 5,团队规模化使用需要按并发规划。其三,价格与活动随时调整,350 元档属于限时体验价,正式采购前建议以开放平台当期报价为准,并按用量估算积分消耗。其四,生成内容需遵守平台规范与相关法律法规,商用前也建议确认素材与肖像的授权。
一句话概括:Vidu 这一轮的看点是把「声音」和「实时」各自做成了一条线——Q3 让画面、对话、旁白、音效与音乐在一次生成里同步产出,单次最多 16 秒并支持三种语言;S2 则把数字人做成可以实时对话、也可以实时换装换景的流式输出,再配上按积分统一计价的开放平台,创作与接入各有一套路径。