腾讯混元WorldClaw:一句话生成可编辑3D世界

一句话构建开放世界:WorldClaw 的技术野心
腾讯混元3D团队近日发布了一项名为 WorldClaw 的技术,其核心卖点在于:用户只需一句简单的文字描述,就能生成一个可探索、可编辑的3D开放世界场景。从「一段热带海岛」到「一处峡谷地貌」,系统会自动完成从文字理解、地形创建、物体摆放到细节完善的全过程。
这项技术的关键并不在于「生成一张3D图片」,而在于生成一个结构化、可二次编辑的场景。据公开说明,其输出由可单独编辑的带纹理网格(textured mesh)组成,这意味着开发者不必接受AI的「一次成型」结果,而是可以在生成基础上继续精修、替换和调整——这正是它区别于早期文生3D工具的核心价值。
带纹理网格是3D图形学中最基础也最重要的资产表示方式。一个网格(mesh)由顶点、边和面组成,定义了物体的几何形状;纹理(texture)则是贴在网格表面的图像,赋予物体颜色、材质和细节。与近年流行的NeRF(神经辐射场)或3D高斯泼溅(3D Gaussian Splatting)等隐式表示不同,网格是一种显式的、离散化的表示方式,天然兼容所有主流游戏引擎(如Unity、Unreal Engine)和DCC工具(如Blender、Maya)。这意味着设计师可以直接对单个物体进行选择、移动、缩放、替换材质甚至修改拓扑结构,而隐式表示往往只能作为整体渲染,难以进行局部精细编辑。WorldClaw选择输出带纹理网格,本质上是在AI生成的便捷性与传统3D工作流的可控性之间找到了一个务实的平衡点。
多模型协同的 Agent 架构
WorldClaw 采用了一套 AI Agent 分步执行的流水线。根据公开信息,系统由 Claude Opus 4.8 驱动作为「大脑」进行任务编排,并在不同环节调用 GPT Image 2、SAM3D 以及混元自家的 Hunyuan3D 等模型完成图像生成、分割和三维重建等具体工作。
AI Agent(智能体)架构是2024年以来生成式AI领域最重要的范式转变之一。传统的AI应用通常是单次输入-输出的模式,而Agent架构允许AI系统自主规划任务步骤、调用外部工具、根据中间结果动态调整策略。WorldClaw中Claude Opus作为"大脑"进行任务编排,本质上是一个基于大语言模型的编排器(LLM-based orchestrator),它将"生成一个热带海岛场景"这样的高层指令分解为地形高度图生成、植被分布规划、单体物件建模、纹理烘焙等子任务,再将每个子任务路由到最合适的专业模型。SAM3D是Meta推出的Segment Anything Model在3D领域的扩展,负责将场景中的不同物体进行精确分割;Hunyuan3D则是腾讯混元团队自研的文本/图像到3D模型的生成系统。
这种「一个调度Agent + 多个专业模型」的组合,反映了当前生成式AI落地复杂任务的主流思路:不依赖单一大模型包打天下,而是通过任务拆解,让每个环节交给最擅长的模型处理。这类似于软件工程中的微服务架构——每个服务专注做好一件事,由一个中枢进行协调。其优势在于每个环节都可以独立升级替换,但挑战在于多模型之间的误差会逐级累积,系统的整体稳定性取决于最薄弱的环节。值得一提的是,这种多模型协同还面临一个实际工程难题:不同模型的输出格式、坐标系、分辨率往往并不统一,中间的格式转换和数据对齐本身就需要大量工程工作,这也是为什么真正可用的Agent系统远比概念演示复杂得多。对于游戏开发和虚拟内容创作而言,这种模块化架构也更利于后续的可控性与迭代。
需要提醒的是,目前该技术能够确认的仅有项目公开页面与演示效果,复杂场景下的稳定性、生成质量的一致性仍有待更多用户实测验证。演示效果与量产可用之间,往往还有不小的距离。
游戏引擎全面拥抱 AI 原生
有意思的是,就在腾讯发布 WorldClaw 的同期,Unity 中国也发布了团结引擎 2.0。新版本围绕跨平台部署与 AI 原生架构升级,重点推出了嵌入编辑器的 AI Agent「团结Codely」,可执行代码编写、场景搭建、测试与错误修复。
Unity是全球使用最广泛的游戏引擎之一,据Unity官方数据,全球排名前1000的移动游戏中超过70%使用Unity开发。团结引擎是Unity中国针对国内市场推出的本地化版本,在合规性、本地化服务和特定平台支持上进行了适配。2.0版本中嵌入的AI Agent"团结Codely"代表了一种新的开发范式——开发者不再需要从零编写每一行代码或手动搭建每一个场景,而是通过自然语言指令让AI完成大量重复性工作。这与GitHub Copilot在代码编辑器中的角色类似,但范围更广,覆盖了从代码生成到场景构建、自动化测试和Bug修复的全开发链路。所谓"AI原生架构",指的是AI能力不是作为插件后加的,而是从引擎底层就被设计为核心组成部分,这使得AI与引擎的交互更深入、延迟更低、能力边界更广。
将这两条新闻放在一起看,趋势就非常清晰了:游戏开发正在从「工具时代」迈向「AI 驱动的生产基础设施时代」。WorldClaw 解决的是内容资产的快速生成,团结引擎 2.0 解决的是开发流程的自动化,二者共同指向一个未来——游戏内容的生产门槛与周期将被大幅压缩。
巨额融资涌入垂直AI赛道
本期新闻中,多家垂直AI公司获得融资,显示资本对细分赛道的持续看好。
AI制药:从降本到「产出新分子」

AI制药公司寻明生科完成总额1亿美元的B轮融资。其创始人提出了一个值得注意的观点:AI制药的价值不只是降本增效,而是持续产出传统研发难以获得的候选分子。这一论断把AI制药的想象空间从「效率工具」提升到了「创新源泉」。
AI制药是将人工智能应用于药物发现和开发全流程的新兴领域,涵盖靶点发现、先导化合物筛选、分子优化、临床试验设计等环节。传统药物研发周期平均需要10-15年,耗资超过20亿美元,而AI的介入有望在多个环节实现数量级的加速。所谓"产出传统研发难以获得的候选分子",是指AI可以在人类化学家难以系统探索的巨大化学空间中发现全新的分子骨架,而非仅仅加速对已知化学空间的搜索。据估计,理论上可能存在的类药小分子数量高达10^60量级,而人类迄今合成过的分子仅约10^8个——这意味着传统方法只触及了化学空间的极微小一隅,而AI驱动的生成式化学有可能系统性地探索这片未知领域。
公司在7月开源了生物结构建模模型 OpenDDE,并称其在部分抗原抗体基准上优于 AlphaFold 3,但也坦言适用范围有限。AlphaFold 3是DeepMind在2024年发布的蛋白质结构预测模型第三代,它不仅能预测蛋白质的三维折叠结构,还能预测蛋白质与DNA、RNA、小分子配体等的复合物结构,被《Nature》评为年度重大突破。寻明生科的OpenDDE聚焦于抗原-抗体相互作用的建模,这是免疫疗法和抗体药物设计的核心问题——抗原-抗体结合涉及高度灵活的互补决定区(CDR),其构象预测难度极高。这类性能宣称目前主要来自公司自身披露,仍需独立验证。
具身智能:不做「世界模型」,要做「原生大脑」

具身智能新锐 Latentverse 完成数亿元种子轮融资。这家公司明确表示不愿被称作「世界模型公司」,而是要打造「具身原生大脑」。其技术路线整合了视觉理解、世界预测与动作生成,并特别强调触觉反馈——这恰恰是当前机器人进入家庭等真实场景的关键短板。
具身智能(Embodied Intelligence)是指将AI赋予物理实体(通常是机器人),使其能在真实世界中感知、决策和行动。与纯数字世界的AI不同,具身智能必须处理物理世界的不确定性、连续性和不可逆性。Latentverse所说的"世界模型"概念源自Yann LeCun提出的自主机器智能架构,核心思想是让AI在内部构建一个对物理世界运行规律的模拟器,从而能够预测行动后果、进行规划。但Latentverse更强调"具身原生大脑",意味着其模型从设计之初就面向机器人控制场景,而非先训练一个通用世界模型再适配到机器人上。这一区分在技术上十分重要:通用世界模型追求的是理解物理规律的广度,而具身原生大脑追求的是在特定任务中实时决策的深度和速度——机器人控制通常要求毫秒级的响应延迟,这对模型的推理效率提出了极高要求。
触觉反馈在机器人领域至关重要:人类完成精细操作(如拧瓶盖、折叠衣物)时,超过80%的感知信息来自触觉而非视觉,当前大多数机器人严重依赖视觉感知,在处理柔性物体、透明物体或需要精确力控的任务时表现不佳。近年来,触觉传感器技术取得了显著进步,例如MIT的GelSight系列传感器通过在弹性体表面嵌入摄像头来获取高分辨率的触觉图像,但如何将触觉信号高效地融入端到端的控制策略中,仍是一个开放的研究问题。
公司计划在一个季度后发布 16B 参数模型。16B的参数规模介于当前主流视觉语言模型和大型语言模型之间,体现了具身智能对推理速度(实时控制需要低延迟)和模型能力之间的权衡。当然,这仍是一张尚未兑现的路线图,最终能否突破泛化能力与复杂操作的局限,还需产品说话。
数据成为AI竞争的下一个战略高地
字节跳动在AI领域再有大动作。据36氪多个信源报道,字节在成立 Seed 和 Flow 两大AI一级部门后,又新设了「AI数据与安全」一级部门,整合多个现有团队,为旗下所有大模型提供跨模态数据服务,覆盖数据生产全流程。
这一组织调整极具信号意义:全球AI竞争正在从算法和算力,转向高质量数据的比拼。在大模型发展早期,Scaling Law(缩放定律)主导了竞争逻辑——更多参数、更多算力就能获得更好的性能。但随着GPT-4级别模型的出现,业界逐渐意识到高质量数据才是真正的瓶颈。具体而言,2022年DeepMind发表的Chinchilla论文指出,此前的大模型普遍存在"参数过多、数据不足"的问题——一个计算最优的模型,其训练数据量应与参数量同比例增长。这一发现直接改变了行业的训练策略,Meta的LLaMA系列就是这一思路的产物:用比GPT-3少得多的参数,但在远超常规比例的数据上训练,最终获得了可比甚至更优的性能。据Epoch AI的研究估计,到2026年前后,互联网上可用于训练的高质量文本数据将基本被耗尽。这迫使各大公司从"被动收集数据"转向"主动生产数据"——包括使用大模型自身生成合成数据(synthetic data),以及与出版商、数据提供商签订大额授权协议。
当模型架构逐渐趋同、算力供给逐步扩容,数据的质量、规模与多模态覆盖能力,正成为拉开差距的关键变量。字节将数据提升至一级部门的高度,意味着数据不再只是训练的输入,而是需要专门的基础设施来进行采集、清洗、标注、合成和质量控制。所谓"跨模态数据服务"更是关键——当模型从纯文本走向多模态(文本+图像+视频+音频+3D),数据对齐(确保不同模态的数据能正确对应)的难度呈指数级上升。以视频-文本对齐为例,不仅需要为每一帧画面匹配准确的文字描述,还需要处理时序关系、因果逻辑和场景切换等复杂语义。字节坐拥抖音、TikTok等全球最大的短视频平台,在视频-文本多模态数据上具有天然优势,这一组织调整正是要将这种数据优势系统性地转化为模型竞争力(截至报道发布时字节尚未回应)。
算力侧同样热闹:IBM 与 Together AI 达成价值2.4亿美元的云服务协议,后者计划在 IBM Cloud 上部署英伟达 AI 推理集群(采用 HGX-B300,预计2027年一季度运行)。HGX-B300是英伟达Blackwell架构的最新服务器平台,Blackwell是继Hopper(H100/H200)之后的下一代GPU架构,其核心创新包括第二代Transformer引擎支持FP4精度推理,使推理吞吐量相比H100提升最高30倍,两颗GPU芯片通过NVLink-C2C互连组成一个超级芯片,拥有超过2000亿晶体管。FP4(4位浮点数)精度推理是一项重要的工程突破——传统深度学习使用FP32或FP16精度,每个数值需要32位或16位存储空间,而FP4仅需4位,这意味着在相同的显存和带宽下,能处理的数据量提升了4-8倍。当然,更低的精度意味着更大的量化误差,Blackwell的第二代Transformer引擎通过动态缩放和混合精度策略来缓解精度损失。值得注意的是,这一协议聚焦于"推理"而非"训练",反映了AI产业正在经历从"训练为王"到"推理为王"的结构性转变——随着越来越多的AI应用进入生产环境,推理计算的总量正在快速超过训练计算量,据估计到2025年推理算力需求将占整体AI算力的60%以上。Together AI是一家专注于开源模型推理和微调的云服务商,选择在IBM Cloud而非AWS或Azure上部署Blackwell集群,反映了AI算力供给正在从少数超大云厂商向更多元化的方向发展。
英伟达自身也在开发 Nemotron 4 系列,最大版本预计至少1万亿参数,试图以开放模型生态带动GPU需求。作为GPU制造商,英伟达亲自下场做模型,表面上是推动开源生态,实质上是通过展示"训练大模型需要大量GPU"来刺激硬件需求,形成硬件-模型-生态的飞轮效应。这一策略与英伟达历史上推动CUDA生态的做法一脉相承:2006年推出CUDA时,英伟达同样通过提供免费的开发工具和丰富的代码示例来降低GPU通用计算的门槛,最终建立了深度学习硬件领域近乎垄断的生态护城河。数据、算力、模型的军备竞赛仍在加速。
监管阴云:桑德斯要求「暂停AI开发」

技术狂奔的另一面,是监管担忧的升级。美国参议员伯尼·桑德斯致信 OpenAI、Anthropic 和 Meta 的CEO,要求他们立即暂停人工智能开发。桑德斯警告称,前沿AI系统的风险正在快速上升,已接近这些公司自己承诺的关键风险阈值,并表示若公司不行动,参议院将介入。
桑德斯的这封信并非发生在政策真空中。2023年3月,Future of Life Institute曾发起一封公开信,呼吁暂停比GPT-4更强大的AI系统的训练至少六个月,获得了包括Elon Musk在内的数万人签名,但最终没有任何一家公司响应这一呼吁。2024年,美国加州SB 1047法案试图对大型AI模型施加安全评估要求,但最终被州长Gavin Newsom否决,理由是该法案可能扼杀创新且仅针对模型规模而非实际风险。欧盟的《人工智能法案》(AI Act)于2024年8月正式生效,成为全球首部全面的AI监管法律,按风险等级对AI系统进行分类管理——从"不可接受的风险"(如社会信用评分系统,直接禁止)到"最低风险"(如AI辅助的垃圾邮件过滤器,无需额外监管)。
桑德斯提到的"公司自己承诺的关键风险阈值",指的是OpenAI的Preparedness Framework、Anthropic的Responsible Scaling Policy等自律性文件——这些公司自己设定了当AI达到某些危险能力(如自主复制、辅助生物武器开发、网络攻击自动化)时应暂停开发的红线。具体而言,Anthropic的RSP将AI风险分为ASL-1到ASL-4四个等级,每个等级对应不同的安全措施要求;OpenAI的Preparedness Framework则通过红队测试对模型在网络安全、生物威胁、说服力和自主性四个维度的危险能力进行评估。桑德斯的逻辑是:既然你们自己画了线,现在到线了就应该停下来。
这一表态标志着对AI失控风险的担忧,已从行业内部讨论正式进入美国国会的政策议程。需要客观说明的是,这只是一名议员发出的政策呼吁,并非已生效的法律或行政命令,但其象征意义不容小觑——如果行业自律被认为失败,强制性监管将更容易获得政治支持。技术发展与监管博弈的张力正在持续加剧。
其他值得关注的动态

- Manus 脱离Meta独立运营:数据存储将转往美国和新加坡。用户需注意,2025年12月29日后的数据将于8月23日被删除,受影响用户应在此前手动备份,公司已提供迁移工具并承诺回归奖励。
- 苹果六款未发布iPhone曝光:iOS 27 Beta 5 代码中首次出现包括传闻中的 iPhone Ultra、iPhone 18 系列、iPhone Air 2 和 iPhone 18e 等机型代号,暗示苹果产品线策略调整,但具体信息仍以正式发布为准。
- SK海力士大连二厂重启:停工4年后即将重启建设,预计年底完成设备导入、明年上半年投产,届时大连NAND总产能将提升约5成。NAND闪存是SSD(固态硬盘)的核心存储介质,2022-2023年因PC和智能手机市场需求疲软,NAND价格暴跌超过50%,全球主要存储厂商均出现大幅亏损。但从2024年下半年开始,AI数据中心的爆发式增长彻底改变了市场格局——训练和推理大模型需要大量高速存储,一个GPT-4级别模型的权重就需要数百GB的存储空间,而推理时的KV-cache更可能消耗TB级存储。值得注意的是,AI对存储的需求实际上涵盖了两个不同层次:HBM(高带宽内存,如SK海力士的HBM3E)直接堆叠在GPU芯片上,提供超高带宽的临时数据存取,是AI训练和推理时模型权重和中间激活值的驻留之处;而NAND闪存则负责更大规模的数据持久化存储,包括训练数据集、模型检查点(checkpoint)和推理日志。企业级SSD的需求因此快速回暖,单个AI服务器的SSD容量需求是传统服务器的数倍。SK海力士大连工厂的重启直接映射了这一市场信号:当AI算力需求带动存储需求,曾经过剩的产能反而变得不够用了。
结语
本期新闻勾勒出一幅清晰的AI产业图景:上层是内容生成与具身智能的应用爆发,中层是数据战略与算力协议的资源争夺,底层是芯片产能的复苏扩张,而外部则是日益逼近的监管压力。 WorldClaw 这样的「一句话造世界」技术固然令人兴奋,但从演示到量产、从宣称到验证,整个行业都还有很长的路要走。
核心要点
相关推荐

两周19.8万星背后:GitHub星星到底在衡量什么
一个开源项目两周狂揽19.8万GitHub Star,却连正式版都没发过。星数到底衡量的是项目质量还是注意力泡沫?本文拆解星数背后的真实信号,并提供一套20秒判读爆火项目成熟度的实用框架。

Spring Boot+Next.js全栈实战:构建AI图片应用完整指南
通过Google Photos克隆项目,学习Spring Boot后端、Next.js前端与ImageKit AI图片处理的全栈开发实战。零成本开源技术栈,一个周末即可完成,掌握AI时代的工程实践能力。

无需本地部署LLM:系统性研究与测试AI护栏的完整方法
详解如何在不本地部署大语言模型的前提下,通过云端API、对抗性测试集和分层验证策略,系统性地研究与测试AI护栏机制,降低AI安全研究门槛。