D-ID:一张照片就能开口说话,还能把视频翻成 120 多种语言

前几年社交平台上流行过一类内容:一张黑白老照片里的人忽然眨了眨眼,开口讲起话来。很多人第一次意识到"照片也能说话",就是从这类视频开始的。做这件事的技术并不神秘,行业里叫说话头像生成(talking head generation)——给它一张人脸和一段语音,它就能预测嘴部、眨眼、眉毛与头部的动作,再把画面渲染出来与音频对齐。

D-ID 是这个方向里做得最早、也最成体系的一家。它把这些能力打包成了一个可用的平台:既能做离线的数字人视频,也能做可以实时对话的可视化智能体。

一张照片就够

D-ID 说话头像生成

D-ID 的门槛低得有点反直觉:上传一张人脸照片,配一段文字脚本或音频,就能得到一段这个人在讲话的视频。官方在 API 文档里的说法是"一张图像就足以创建一段说话头像视频",不需要三维建模,不需要动捕设备,也不需要本人到场。

上传人脸照片生成数字人

输入的图片有明确限制:单张不超过 10 MB,支持 JPEG、JPG 与 PNG 三种格式。成片统一输出为 MP4,标准数字人的分辨率上限是 1280×1280;想要 1080p,需要使用带 HQ 标记的 Premium 数字人。

另一条容易被忽略的限制是时长:无论是用 Creative Reality Studio 还是调用 API,单条视频的长度都被限制在 5 分钟以内。这意味着它适合做讲解、说明、问候这类短内容,指望它一口气生成一整节课并不现实——长内容需要拆成多段分别生成。

说完中文还能说另外 119 种

生成只是第一步,D-ID 真正被企业拿去用的原因在本地化。官方口径是平台支持 120 多种语言的视频生成与实时交互。同一张脸可以在不同语言版本里保持完全一致,不会因为是另一个语种就换一个人。

如果你手上已经有成片,D-ID 提供视频翻译:点击几次就能把整段视频翻译成多种语言,并且会克隆原说话人的声音,同时把唇部动作适配到新语言上,而不是简单地叠一层配音。做全球发布的团队最省事的其实是这一点——同一份素材,一次生成,多语言版本同时到位。

能实时对话的数字人

D-ID 近两年把重心明显移到了 Visual Agents 上:不再是生成一段固定视频,而是生成一个能听、能答、有表情的实时数字人。

D-ID 实时对话数字人

官方给出的性能指标是回答准确率超过 90%、响应在两秒以内。构建过程分成几步:挑一个数字人(可以用成品形象,也可以做本人的数字分身),选一种声音(合成音色、克隆自己的声音或上传音频),定义角色与性格,接入知识内容,再挂上 webhook 让它能触发外部动作。

D-ID 智能体工作流程

知识库部分支持上传文档,官方限制是最多 5 个文档、每个文档最多 50 万个字符;大模型可以接入任意供应商,也可以自带。这些文档里的内容不会进入大模型本身,只作为检索来源,所以把内部资料喂给它是可行的。

部署方式上,智能体可以嵌入网站、应用、学习管理系统、客服门户、移动端甚至线下一体机。官方为所有人提供 200 次免费对话会话用于上手,之后按套餐计费,智能体的用量按每 15 秒 0.5 个积分折算。

合规这条线

让一张陌生人的脸开口说话,天然带着滥用风险,所以 D-ID 在合规上花的心思比同行多。它已经拿到 ISO/IEC 27001、ISO/IEC 27017、ISO/IEC 27018、ISO/IEC 42001 等一系列认证,并通过 SOC 2 认证;其中 27018 针对云环境中的个人身份信息保护,与 GDPR 直接相关。Studio 页面另外提到 TISAX 与"完全 GDPR 就绪"。

更实际的一条承诺是:你的视频、脚本、文档与数字人始终归你所有,平台不会拿这些内容去训练模型,所有数据在传输中与静态存储时都加密。对于要把内部培训材料或客户信息放上去的企业,这条比认证编号更有说服力。

开发者与套餐

除了网页版的 Studio,D-ID 提供完整的生成式 API,可以把它嵌进自己的产品里批量出片。文档里把视频能力分成几代:V4 Expressive 支持带情绪的表达,V3 Pro 输出 Full HD 并带自然肢体动作,V3 Instant 用自己的视频素材定制数字人,V2 Photo 则是从一张照片生成说话头像。此外还有实时流式接口、SDK 与可嵌入组件。

D-ID 生成式 API

套餐分为 Trial、Lite、Pro、Advanced 与 Enterprise 五档,官方定价页按套餐列出具体金额与包含的视频时长。几个与选型直接相关的差异是:

套餐

视频水印

Premium 数字人

说明

Trial

有全屏水印

支持 1080p

免费试用,先验证效果

Lite

有水印

不支持

入门付费档,分辨率上限 1280×1280

Pro

无水印

支持 1080p

常规商用档

Advanced

无水印

支持 1080p

更高用量与权益

Enterprise

无水印

支持 1080p

定制用量、私有化与专属支持

需要提醒的是,套餐里的视频时长按月计算,未用完的分钟数不会结转到下个月,过期作废;通过 API 消耗的时长与网页版共用同一个余额。如果用量波动大,建议按峰值之外的量来选档,避免月底突击消耗。

它适合谁

D-ID 的优势在于门槛与灵活性:一张图就能起步,既能在网页里几分钟出片,也能用 API 批量生成,还能做成实时对话的智能体挂在官网上。对需要把同一份内容铺到多个语言市场、或者想要一个 24 小时在线的讲解员的团队来说,这套组合很实用。

但它也有清晰的边界。5 分钟的时长上限决定了它做不了长课程;Lite 档不支持 Premium 数字人,分辨率也要打折扣;想要真正去掉水印、拿到 1080p,至少要从 Pro 档起步。另外,数字人的表现力仍然集中在"讲话"这一件事上,需要复杂表演、真实场景拍摄的内容,它替代不了。

用之前还有一件事值得先想清楚:你准备让谁的脸开口说话。如果用的是他人照片,授权问题比技术问题更难处理,这一点在官方的伦理条款里也被反复强调。

这类工具最合适的用法,是把"需要有人出镜讲一遍"的重复性内容交给它,把真正需要真人出场的表达留给真人——省下的不是制作费,而是等待排期的时间。

D-ID下载地址
支持的操作系统: Web