腾讯混元 WorldClaw:一句话生成可漫游、可逐物编辑的 3D 开放世界

腾讯混元 3D 团队公开了 WorldClaw:一句开放式描述进去,一个能走进去、还能逐件修改的 3D 世界出来。

让模型照着文字画出一片山川,这两年已经不算新鲜事。难的是另一件:画面里看着像世界,可它并不真的是一个世界。你走不进去,也改不动——树木和房屋糊在一张图上,想挪一棵树,往往要重新生成整幅画面。

WorldClaw 想填的就是这道落差。它把「搭一个世界」拆成一条由粗到细的多 Agent 流水线,先立骨架、再填细节,最终交出一套带纹理、彼此独立的 3D 网格。论文在 2026 年 8 月挂上 arXiv,项目页同步公开,官方放出 11 个生成世界作为示例。

3d world generation
官方放出的生成世界之一:山体、河谷、植被与建筑在一次生成里同时成型。

先立骨架,再填细节

整条流水线分三步,每一步由各自的 Agent 负责,中间靠一份共享的结构化表示传递信息。第一步是意图分析与规划:意图分析 Agent 只抽取你确实说过的约束,不替你脑补;场景规划 Agent 再把缺口补齐,输出一份覆盖区域划分、地形参数、物体类别、材质风格与空间关系的场景规格。

第二步生成全局地形。系统先画出一张彩色编码的语义布局图,再用带区域权重的高度场,把基础高程、多频噪声以及山峰、沙丘、台地、侵蚀这类地貌算子叠加起来,让山地、河流、平原在边界处自然过渡,而不是生硬拼接。地表材质同样按区域分配,既可以是生成出来的纹理,也可以写成程序化节点。

第三步才轮到细节。它没有把整个世界一次塞满,而是先挑出既需要内容、地形条件又合适的区域,只在这些地方集中算力。

artificial intelligence technology
官方方法总览:意图分析与规划、全局地形生成、区域物体生成与放置三个阶段,靠一份共享的结构化表示衔接。

每个物体都留成独立网格

区域内容生成这一段,做法和直接在三维空间里生成网格不太一样。系统先把已有地形渲染成一张二维图像,交给图像编辑模型在图上补画建筑、车辆和植被,得到一张地形条件下的合成图;再让分割模型把单个物体切出来,逐个重建为带纹理的三维网格,最后通过光线求交,把物体放回地形上对应的位置。

尺度也要校准:重建出的网格重新渲染后,在画面里占据的面积,要和当初切下来的那一块大致相当。正因为每个物体都保留了自己的形状、位置、尺度和纹理,想换掉一棵树、把房子往旁边挪几米,改的是那一个对象,周围地面不用跟着重做。

3d modeling software interface
同一个世界的四种渲染通道:外观、实例掩码、表面法线与深度。

渲染检查的闭环

物体放完并不等于完工。精修 Agent 会通过 MCP 接口连上 Blender,从多个视角重新渲染,检查比例、姿态以及物体和地面的接触关系。悬空的、陷进去的、穿模的、尺度明显不对的,都会被挑出来,然后调整物体的位置,或者局部抬升、平滑它脚下那一小块地形,再重新渲染确认。

这套渲染、检查、修改的循环,也是它敢把地形和物体分开生成的原因:局部动过之后,全局仍然保持连贯。

terrain landscape rendering
生成世界的等距全景,地形与逐一放置的实例资产都在同一张图里。

现在能用到什么程度

要说清楚的是,WorldClaw 目前仍是研究阶段的项目。官方公开的是论文与项目页,代码、模型权重和接口都还没有放出,也没有任何定价信息。论文里的实验跑在 Blender 5.1.1 环境与四张 NVIDIA H20 显卡的服务器上,作者也说明每增加一个物体、每多做一轮修复,时间和成本都会往上走。

论文对自身的局限写得比较直接。一是依赖模型能力:最终画面质量受三维生成模块上限的约束,换成弱一些的模型,效果会明显下滑。二是代码生成不够稳定:地形构建、材质生成、物体摆放和局部精修中有几个环节依赖大模型临时写程序,尺度估计、数值参数或节点连接上一出错,就会直接反映成地貌不连贯、材质不对。

它交出的是可编辑的场景资产,不是能直接玩的游戏。导航、物理与交互逻辑需要后续再接,官方把游戏引擎集成列进了后续工作。对做关卡原型、虚拟制片预演或数字孪生的人来说,这套思路值得持续关注;至于什么时候能真正拿到手上用,还要看官方的下一步。

WorldClaw 的价值不在「一句话造个世界」这句话本身,而在于它把世界拆成了可检查、可修改的零件。眼下它还是一篇论文加一个项目页,但这条由粗到细、边渲染边修正的路子,已经把 3D 场景生成往「能改」的方向推了一步。

WorldClaw下载地址
支持的操作系统: Windows macOS Linux Web