World Labs发布Atlas:三部手机拍出子弹时间效果

World Labs发布Atlas世界模型,三部手机即可生成子弹时间效果并构建机器人仿真训练环境。
李飞飞创立的World Labs发布了空间智能模型Atlas,其核心能力是将时间与空间统一建模,实现「时空仿真」。在创意内容领域,Atlas仅需三到五部普通手机拍摄的稀疏视角素材,即可生成好莱坞级别的「子弹时间」效果,无需专业相机阵列或绿幕棚;在机器人训练领域,Atlas能从真实录像中构建支持刚体、铰接体和可变形物体交互的仿真环境,并随机器人运动轨迹实时生成第一视角感知数据,大幅降低Real-to-Sim的成本。其底层采用多模态自回归扩散Transformer架构,以精确相机几何而非模糊文本提示来锚定空间关系,从架构层面保证了空间一致性。Atlas的发布印证了「世界模型」正成为通往具身智能的关键路径。
空间智能的新里程碑
World Labs近日发布了全新的全维世界模型——Atlas。作为由AI教母李飞飞创立的空间智能公司,World Labs一直致力于让机器真正理解和构建三维世界。这次发布的Atlas模型,凭借其时空模拟(space-time simulation)能力,被业内视为新视角合成(novel view synthesis)和机器人训练领域的一次重大跃进。
与传统的3D重建或视频生成模型不同,Atlas的核心在于将「时间」与「空间」统一建模——不仅能重建静态场景,还能主动生成动态过程中的视觉数据。这一特性对于自动驾驶、具身智能等需要海量仿真数据的场景,具有极强的实用价值。
三部手机拍出好莱坞级「子弹时间」
Atlas最令人瞩目的技术亮点之一,是它的稀疏视角(Sparse-View)「子弹时间」能力。
所谓「子弹时间」,源自电影《黑客帝国》中那个经典的凝固时间、镜头环绕拍摄的画面。传统上,要实现这种效果,需要在拍摄现场布置数十甚至上百台经过精密校准的相机阵列,配合绿幕和专业捕捉棚,成本极其高昂。
而Atlas宣称,只需要三到五部普通手机拍摄的素材,就能生成凝固时间、自由移动镜头的多视角穿越画面。这意味着:
- 无需校准过的相机阵列
- 无需绿幕背景
- 无需专业捕捉工作室
模型能够根据这些稀疏、非专业的拍摄素材,自由地重新构图和调整镜头角度。这实际上是把过去只有好莱坞级制作团队才能实现的视觉效果,降维到了消费级设备上。对于内容创作者和影视工作者而言,这种「平民化」的子弹时间技术路径,可能会显著降低高端视觉特效的制作门槛。
从技术原理上看,稀疏视角重建依赖的是神经辐射场(NeRF)或3D高斯泼溅(3D Gaussian Splatting)一类的隐式场景表示方法。传统方法要求输入图像之间有大量重叠、拍摄角度均匀分布,才能可靠地恢复场景几何。「稀疏视角」(Sparse-View)的难点在于:当输入图像数量极少、角度差异较大时,模型必须依靠强大的先验知识来「脑补」未被观测到的区域,否则重建结果会出现严重的几何失真和模糊。Atlas宣称仅凭三到五段手机视频就能完成这一过程,意味着其世界模型在训练阶段积累了足够丰富的三维世界先验,可以在信息不足的情况下做出合理的空间推断。
面向机器人的「Real-to-Sim」仿真数据生成
如果说子弹时间面向的是创意内容领域,那么Atlas真正的野心在于机器人训练。
当前具身智能发展的最大瓶颈之一,是训练数据的稀缺。真实世界中采集机器人行为数据成本高、效率低,而纯虚拟仿真又往往难以还原真实物理世界的复杂纹理和光照。Atlas提出的「生成式Real-to-Sim」路径,试图弥合这道鸿沟。
主动生成传感器数据
Atlas的独特之处在于,它不只是重建一个静态的3D环境。当仿真机器人在场景中移动时,Atlas会主动生成该机器人机身相机在特定运动轨迹上应当观测到的RGB图像和深度数据。
换句话说,机器人「看到」的画面不是预先渲染好的,而是随着行动轨迹实时生成的。这种以轨迹为条件的动态生成方式,让仿真数据更贴近机器人在真实部署时的第一视角感知。
支持复杂的物理交互场景
更进一步,Atlas能够从随手拍摄的真实录像中,构建捕捉物体运动与交互方式的仿真环境。它支持三类物体:
- 刚体(rigid):如箱子、工具等不变形物体
- 铰接体(articulated):如门、抽屉、机械臂等有关节的物体
- 可变形物体(deformable):如布料、软质材料等
用户还可以动态修改场景中的光照、背景和物体位置,从而以极低的成本生成多样化的机器人训练数据。这种数据增广(data augmentation)能力,正是解决机器人泛化难题的关键所在。
「Real-to-Sim」(现实到仿真)是机器人领域的核心挑战之一,与之对应的还有「Sim-to-Real」(仿真到现实)问题。后者指的是:在虚拟仿真环境中训练好的机器人策略,往往因为仿真与真实世界之间的视觉、物理差异(即「仿真鸿沟」,Sim-to-Real Gap)而在真实部署时失效。Real-to-Sim则反其道而行之——先扫描或录制真实场景,再将其转化为可交互的仿真环境,从而保证训练数据的视觉真实性。传统Real-to-Sim流程依赖深度相机、激光雷达等专业硬件,以及繁琐的人工标注。Atlas试图用普通视频替代专业设备,并通过生成式模型自动补全物理属性,大幅降低流程门槛。
技术底座:多模态自回归扩散Transformer架构
从架构层面看,Atlas被构建为一个多模态自回归扩散Transformer(multimodal autoregressive diffusion transformer)。这是一种融合了自回归生成与扩散模型优势的混合架构:自回归部分负责建模时序与轨迹的连贯性,扩散过程则保证生成画面的高保真度。
以精确相机几何为原生输入
Atlas与许多视频生成模型的关键区别,在于它对镜头运动的控制方式。
多数现有模型依赖粗糙的文本提示(text prompting)来描述相机运动,比如「镜头向左平移」「缓慢推近」——这类描述本质上是模糊且不精确的。而Atlas则将精确的相机几何(camera geometry)作为原生输入,把所有生成内容都锚定在一个共享的「空间上下文」(spatial context)中。
这一设计的意义在于:模型对空间的理解不是靠语言「猜」出来的,而是建立在真实几何约束之上。这也解释了为什么Atlas能实现如此精确的自由视角合成和轨迹相关的数据生成——空间一致性从底层架构就得到了保证,而非事后修补。
自回归模型(Autoregressive Model)与扩散模型(Diffusion Model)代表了当前生成式AI的两条主流技术路线。自回归模型逐步预测序列中的下一个token,天然擅长建模时序依赖关系,GPT系列即属此类;扩散模型则通过逐步去噪过程生成高质量图像,Stable Diffusion、DALL·E 3等图像生成模型均基于此原理,其优势在于生成细节丰富、画面保真度高。将二者融合的「自回归扩散Transformer」架构,旨在同时获得两者的优点:用自回归机制保证时间序列和运动轨迹的一致性,用扩散过程保证每一帧的视觉质量。这种混合架构近年来在视频生成领域逐渐受到关注,是当前世界模型研究的前沿方向之一。
Atlas的意义与未来展望
Atlas的发布,进一步印证了「世界模型」正在成为AI下一阶段的重要方向。相比只会生成好看画面的视频模型,能够理解三维空间、时间演化和物理规律的世界模型,才是通往通用具身智能的必经之路。
从三部手机的子弹时间效果,到可扩展的机器人仿真数据生成,Atlas展示了一条从消费级创意应用延伸到工业级机器人训练的完整技术脉络。当然,目前这些能力多来自官方的技术宣传,其在实际复杂场景中的鲁棒性和生成质量的稳定性,仍有待更广泛的第三方验证。
但可以确定的是,随着空间智能技术的不断成熟,「用几部手机就能重建并仿真一个可交互世界」的愿景,正在从科幻走向现实。
相关推荐

Harbor:统一80+基准的AI Agent评估框架详解
深入解析Harbor Adapters和Harbor-Index如何通过统一适配器层整合80+基准测试,开展8模型×54基准的大规模AI Agent评估实验,并构建82个高质量任务的元数据集,推动Agent评估标准化。

日元跌破160关口:央行干预为何难挡贬值趋势
日元兑美元再度跌破160关键心理关口,日本央行外汇干预效果被迅速侵蚀。本文深入分析美日利差、套利交易、输入型通胀等核心因素,解读日元持续走弱的结构性原因及未来走势展望。

Grok代理模式实测:一句话自动生成完整视频流程详解
实测Grok 4.6代理模式,用一句话自动完成儿童睡眠视频制作全流程。详解图片生成、视频转换、配乐拼接的自动化效果,以及SUNO配乐协同和剪辑优化技巧。