腾讯WorldClaw:一句话生成可编辑3D游戏世界

腾讯WorldClaw用多智能体架构实现文字一键生成可编辑3D游戏场景,Wan-Animate-2开源支持文字控镜与多角色动画驱动,生成式AI全面向3D与动态内容延伸。
腾讯推出的智能体系统WorldClaw借助多智能体协作架构,将一句文字提示转化为包含地形、建筑、植被的完整可编辑3D游戏场景,流程涵盖规划、语义高度场生成、资产生成与自我检查修正四个环节,大幅降低了游戏场景搭建的门槛。与此同时,Wan团队开源的角色动画模型Wan-Animate-2带来了文字控制镜头视角和多角色同步驱动两项关键能力,突破了传统视频驱动方案在视角上的限制。两项进展共同指向同一趋势:生成式AI正从二维静态内容向三维动态复杂系统演进。当前WorldClaw仍受制于算力成本,难以实时生成大型世界,但这被视为工程优化层面的瓶颈而非方向性障碍。
一句话生成3D游戏世界,AI创作再进一步
当我们还在惊叹于文生图、文生视频的进展时,腾讯已经把生成式AI推向了更复杂的3D游戏世界构建领域。据B站UP主EVER AI的分析,腾讯推出的智能体系统「WorldClaw」(World Cloud),只需一个文字提示,就能在Blender中构建出相对完整的3D环境——地形、建筑、植被全部是独立可编辑的模型,创作者可以随意拆改调整。
这与传统的3D建模流程形成了鲜明对比。过去搭建一个游戏场景,需要美术、建模、场景搭建等多个环节协作,耗时以周甚至月计。而WorldClaw把这一切压缩到了一句话的输入门槛,背后依靠的是多智能体(Multi-Agent)的协同架构。

WorldClaw的多智能体工作流解析
从模糊想法到详细规划方案
WorldClaw的核心亮点在于它并非「一步到位」的黑盒生成,而是将任务拆解为多个Agent环节依次执行。系统首先会把用户模糊的想法转化为详细的规划方案,包括不同区域的划分、地形类型、物体分布、材质选择以及物件之间的空间关系。
这一步相当于给整个场景搭建了一份「施工蓝图」,确保后续生成的内容在逻辑上自洽,而不是随机堆砌素材。
语义高度场与3D资产生成
在规划确定后,系统会生成带有区域语义的高度场(heightmap),用来确定山峰、峡谷、河流等地貌的具体位置和形态。有了这个空间骨架,各个Agent再分头生成对应的3D资产,最终拼装成一个完整的场景。

高度场(heightmap)是一种用二维灰度图编码地形高度信息的技术:图像中每个像素的亮度值对应地表某点的海拔,白色代表最高点,黑色代表最低点。游戏引擎和3D软件读取这张图后,即可自动生成对应的地形网格。WorldClaw在此基础上引入了「语义」维度——不仅记录高低起伏,还为不同区域标注类型信息(如「山地」「湿地」「建筑用地」),使后续各Agent能够根据区域语义选择对应的资产类别和密度规则,而不是简单地按高度随机填充。这种语义高度场的设计,是整个多智能体流水线能够保持场景逻辑自洽的关键基础。
自我检查与自动修正机制
值得关注的是,WorldClaw在完成初始场景后,还具备自我检查的能力。它会从多个角度审视生成结果,主动发现并修正模型悬空、穿模等3D生成中常见的问题,并自动补全缺陷。这种「生成—检查—修正」的闭环设计,让最终产物的可用性大大提升,减少了人工返工的成本。
多智能体(Multi-Agent)架构指将一个复杂任务分解后,交由多个专职AI代理(Agent)分工协作完成,每个Agent负责特定子任务并可相互通信。与单一大模型「一次性输出」相比,这种流水线设计的优势在于:每个Agent可以使用针对其子任务优化的模型或工具,中间结果可被检验和修正,整体输出的可控性和质量显著提升。WorldClaw中,规划Agent、地形生成Agent、资产生成Agent和检查Agent各司其职,正是这一范式的典型实践。近年来,LangChain、AutoGen等框架的普及,使多智能体架构从研究走向了工程落地。
WorldClaw现阶段的局限性
技术虽然惊艳,但研究者也保持了清醒。据分析,目前WorldClaw还无法实现实时生成大型游戏世界。更关键的约束在于成本:场景越大、物件越多,耗时和算力开销就会显著上升。这意味着当前的WorldClaw更适合中小规模的场景生成,距离真正的「AI一键造大世界」还有优化空间。

不过从技术演进的角度看,这类局限更多是算力和工程优化层面的问题,而非方向性的障碍。随着模型效率的提升和硬件成本的下降,实时大世界生成或许只是时间问题。
Wan-Animate-2:端到端角色动画的开源突破
除了3D世界生成,动画领域同样迎来重磅开源。Wan团队开源了角色动画模型Wan-Animate-2,带来了几项关键升级。
文字控制镜头视角
与一般「通过视频驱动图片角色、做出相似动作」的方案不同,Wan-Animate-2新增了通过文字修改镜头视角的能力。当你参考一段正面动作视频时,可以直接用文字要求生成结果呈现侧面或其他镜头角度的效果。

这一能力打破了参考视频对最终视角的束缚,让创作者能够以更低的成本获得多角度的动画内容,极大拓展了应用的灵活性。
传统的视频驱动角色动画方案(如基于姿态估计的ControlNet流程)通常将参考视频的拍摄视角直接「烘焙」进生成结果——参考视频是正面,输出也只能是正面。这是因为模型本质上在做2D骨骼关键点的迁移,缺乏对三维空间的理解。Wan-Animate-2能够通过文字指令改变最终镜头视角,意味着模型内部建立了对角色三维姿态的隐式表征,能够在保留动作语义的同时,从不同空间角度重新渲染输出。这一能力对动画制作流程有实质影响:创作者无需为每个镜头角度单独拍摄或制作参考素材,一段动作素材可以复用为多角度内容。
多角色协同驱动
另一个亮点是,Wan-Animate-2支持驱动场景中多个不同身材比例的角色同时运动。这意味着复杂的多人交互场景也能通过该模型生成,而不必逐个角色单独处理。对于制作群像动作、互动场面的创作者来说,这无疑是效率的巨大提升。
更重要的是,该模型已经开源,用户在本地部署即可运行,降低了尝鲜和二次开发的门槛。
生成式AI正在重塑3D内容生产流程
无论是腾讯WorldClaw对3D游戏世界的构建,还是Wan-Animate-2对角色动画的端到端处理,都指向同一个趋势:生成式AI正在从二维内容走向三维、从静态走向动态、从单一任务走向复杂系统的协同。
多智能体架构在WorldClaw中的应用尤其值得关注——它证明了「规划—生成—检查」的Agent协作范式,能够处理远比单次生成更复杂的创作任务。尽管当前还有算力成本、实时性等瓶颈,但这些工具的开源和落地,正在把专业级的3D与动画创作能力,逐步交到更多普通创作者手中。
相关推荐

Rootprint:基于S3对象存储的低成本开源日志搜索工具
Rootprint 是一款基于 Quickwit 和 S3 对象存储的开源日志与追踪搜索工具,支持倒排索引全文检索,月存储成本仅300美元即可保留24个月日志。适合个人开发者和小团队的轻量级可观测性方案。

OpenAI声称攻克数学难题:AI推理能力的重大突破
OpenAI宣布其AI代理解决重要数学开放性问题,引发学术界广泛争议。深度解析AI数学推理能力突破的意义、验证挑战及对科学研究的深远影响。

告别1Password:自托管密码管理器全方案对比
深度对比Vaultwarden、PassBolt、AliasVault、KeePass等自托管密码管理器方案,从Passkey支持、2FA、家庭共享到迁移成本,帮助你找到替代1Password的最佳选择。