AI抛硬币不是50%:世界模型如何改变AI的未来

一个反直觉的实验:AI抛硬币的概率偏差
现实世界中抛一枚硬币,正面朝上的概率大约是50%,这是常识。但如果在AI生成的世界里抛硬币,结果还会是50%吗?
影视飓风团队做了一个有趣的实验——他们在多个AI视频生成模型中投了几百次硬币,使用完全相同的提示词。结果出人意料:某个模型大约有70%的概率生成正面(数字面)朝上的结果,其他模型的偏差同样显著。明明给AI的指令是"随机"的,人类点击按钮的行为也是随机的,但生成结果却远远偏离50%。
这个看似无厘头的小实验,实际上揭示了当前生成式AI面临的两个根本性问题,也指向了一个正在改变整个科技界的技术方向——世界模型(World Model)。
当前AI视频生成的两大致命弊端

弊端一:能骗眼睛,骗不了物理定律
过去半年,AI生成的视频越来越逼真,甚至出现了"用AI生成的AI生成视频"。要判断一段影像是否来自真实世界,人类已经几乎一败涂地。但AI仍然有一个致命弱点:它不理解真实的物理规律。
生成式AI的工作原理是在海量训练数据中提取规律,但这种"规律"并非真实世界的物理定律,更像是它根据数据"画"出来的一种模式。以抛硬币为例,在电影、广告和日常视频中,硬币正面清晰展示的镜头远多于反面——这就是所谓的数据偏见(Data Bias)。
数据偏见是机器学习领域最核心的挑战之一。当前主流的生成式AI模型——无论是基于Transformer架构的大语言模型,还是基于扩散模型(Diffusion Model)的图像/视频生成系统——都依赖于从海量数据中学习统计规律。然而,训练数据本身并不是对真实世界的均匀采样。人类在拍摄硬币时倾向于展示正面(通常刻有国徽、人像或数字等辨识度更高的图案),这种拍摄偏好被编码进了训练集。模型在学习过程中无法区分"物理事实"和"数据中的统计特征",它只能忠实地复现数据分布中的模式。这也是为什么在自动驾驶、医疗影像等高风险领域,数据偏见的消除被视为比模型架构改进更为紧迫的任务。
AI学到的不是"硬币正反面概率相等"这个物理事实,而是"人类拍摄的硬币视频中正面出现更多"这个统计特征。
弊端二:算力消耗巨大,质量难以保证
高质量AI视频生成对计算资源的消耗是惊人的。曾经备受关注的Sora 2模型(现已关闭服务),生成一段10秒左右的视频,服务器大约需要消耗整整一度电,并蒸发掉相当量的冷却用淡水。如此高昂的算力成本,却不一定能保证物理上的正确性,这显然不是一条可持续的路径。
这种算力瓶颈与当前主流的扩散模型(Diffusion Model)架构密切相关。扩散模型的基本原理是:先向数据中逐步添加噪声直至完全随机,再训练神经网络学习逆向去噪过程。生成时,模型从纯噪声出发,经过数十甚至数百步迭代去噪,最终生成清晰的图像或视频帧。每一步去噪都需要完整地运行一次大规模神经网络的前向推理,这使得计算量随视频分辨率、帧数和去噪步数呈指数级增长。以Sora为代表的视频生成模型通常在潜空间(Latent Space)中操作以降低维度,但即便如此,生成一段高质量视频仍需要数千亿次浮点运算。这也催生了蒸馏(Distillation)、一致性模型(Consistency Model)等加速技术的研究热潮。
世界模型:从模仿表象到理解物理世界

那么,这两个问题有没有解法?答案是世界模型(World Model)。
什么是世界模型?
简单来说,世界模型是一种能够预测"当我采取某个行动后,世界会发生什么变化"的AI模型。它的工作流程可以分为三步:
- 观察世界:它知道这是一枚硬币,了解它的大致重量、正反面是否均等、从什么位置开始抛、落在什么材质上。
- 预测未来:这是世界模型最核心的能力——它会推演接下来无数种物理走向的可能性。
- 判断执行:基于想象出来的未来,判断行动带来的结果,再去执行。
世界模型的概念有着深厚的学术渊源。最早可追溯至认知科学家Kenneth Craik在1943年提出的"内部模型"理论,他认为人类大脑会构建外部世界的小型化模型来预测事件。在AI领域,Jürgen Schmidhuber在1990年代提出了类似的框架,而这一概念在2018年被David Ha和Schmidhuber的论文《World Models》重新激活——他们展示了一个能在"梦境"中学习驾驶策略的AI系统。2024年以来,Meta的首席AI科学家Yann LeCun大力倡导的JEPA(Joint Embedding Predictive Architecture)架构,被认为是通向真正世界模型的重要路径。LeCun认为,当前基于生成式方法的AI本质上是在像素空间做预测,而真正的世界模型应该在抽象表征空间中进行推理,这与人类大脑的工作方式更为接近。
本质上,世界模型与人类的直觉非常接近。我们在接住一个球之前,大脑会瞬间预测球的轨迹;我们在倒水时,会自然地预判水流的方向。世界模型要做的,就是让AI也具备这种对物理世界的直觉理解。
世界模型生成的是三维可交互世界
与传统的视频生成模型不同,世界模型生成的不是二维的视频帧序列,而是三维的、可交互的物理世界。影视飓风团队演示了用一句话生成一个中世纪堡垒场景——有电子光效、大理石地板、遗迹风格的物体。你可以在这个场景中转圈、俯冲,甚至与世界交互,就像游戏一样。
这种三维可交互场景的生成能力,与近年来神经辐射场(NeRF, Neural Radiance Fields)和3D高斯溅射(3D Gaussian Splatting)技术的突破密切相关。NeRF由UC Berkeley团队在2020年提出,通过神经网络隐式表示三维场景,从多角度二维图像中重建出可自由视角渲染的三维空间。而2023年提出的3D高斯溅射则用显式的三维高斯椭球体来表示场景,渲染速度比NeRF快数个量级,达到了实时交互的水平。这些技术为世界模型提供了高效的三维场景表示基础,使得AI不再局限于生成二维像素序列,而是能够构建具有空间一致性的三维环境。
虽然目前画面还比较粗糙,但它已经初步具备了模拟三维物理世界的能力,大大降低了模型产生"物理幻觉"的概率。
Google OMNI:世界模型的最新进展

Google近期发布了融合世界知识理解的视频生成模型Veo 3 OMNI。根据官方说法,OMNI是一个学习了力学、数学、世界历史的多模态模型,已经非常接近人类对物理世界的认知。
它的物理模拟水平有了明显提升,生成的人物更像真人,少了以往AI视频那种"恐怖谷"的违和感。但真正让人震撼的是它的场景修正能力:
- 说话者的背景可以实时替换
- 手触摸的桌面材质可以随意变换
- 手中握的物体可以自由改变
- 即便是流体、透明物体,都能很好地映射和处理
这种对场景的深度理解和灵活修正能力,是以前的AI视频模型从未展现过的。不过,OMNI本质上仍然在生成二维视频。如果未来能在二维视频中实现自由运镜,或者将三维世界模型提升到更高的精度,AI视频创作的所有痛点都有望被彻底解决。
超越视频:世界模型的更大想象空间

世界模型的价值远不止于视频生成,它正在多个领域展现出颠覆性的潜力。
游戏行业:无尽的虚拟世界
如果一个世界可以无限制地生成,那它就是一个无尽的游戏。以前需要花几周时间建模的场景,现在只需一次算力就能生成。世界模型对游戏行业的冲击将是颠覆性的——从关卡设计到开放世界构建,开发效率可能提升数个量级。
机器人训练:虚拟世界中的无限试错
把机器人丢进一个仿真的世界模型中,它可以无限次地打翻杯子、无限次摔倒重来。通过这种方式,机器人能学会什么是轻重、什么是高低、什么是远近,四肢运动可以像有肌肉组织的真人一样自然。
虽然目前机器人的姿态控制已经相当出色,但距离最高预期仍有差距——而世界模型正是缩小这个差距的关键技术。
4D高斯技术:未来影像体验的雏形
影视飓风团队分享了一个实际案例:他们使用4D高斯技术,用250台相机拍摄真实演员和场景,再通过计算机训练重建,制作了一部时长35分钟的VR短片。在这个短片中,观众可以移动到空间的任何角度去观察虚拟世界中正在发生的事情——可以看着前面的角色,也可以走开去端详其他角落。
4D高斯技术是3D高斯溅射在时间维度上的自然扩展。传统的3D高斯溅射用大量三维高斯椭球体的位置、协方差、颜色和透明度来表示静态场景;4D高斯则为每个高斯体引入了时间参数,使其位置、形状和外观可以随时间变化,从而表示动态场景。影视飓风团队使用250台相机进行多视角同步拍摄,本质上是在每个时间点获取足够多的视角信息,再通过优化算法重建出每一帧的三维高斯场。这种"自由视角视频"(Free-Viewpoint Video)技术此前主要应用于体育赛事转播(如Intel的True View系统),但成本极高。随着算法效率的提升和世界模型的成熟,未来有望大幅降低对硬件采集设备的依赖。
虽然这目前还需要大量硬件设备来实现,但它展示了世界模型成熟后影像体验的雏形:如果未来一句话就能生成这样的四维动态世界,内容创作和消费的方式都将发生根本性的变革。
AI抛硬币终将接近50%
回到最初的问题。AI抛硬币概率不是50%,本质上是因为当前的生成模型不理解物理世界,只是在模仿训练数据中的统计分布。而世界模型的出现,正是要从根本上解决这个问题——让AI不仅"看起来像",更要"物理上对"。
英特尔、英伟达等芯片巨头正在大力推进NPU与世界模型的结合,未来的AI PC可能不只是生产力工具,而是个人数字世界的模拟器。NPU(Neural Processing Unit,神经网络处理单元)是专门为AI推理任务设计的硬件加速器,与通用CPU和图形处理GPU不同,NPU针对矩阵乘法、卷积等神经网络核心运算进行了深度优化,能以更低的功耗完成更高吞吐量的AI计算。英特尔从Meteor Lake架构开始在消费级处理器中集成NPU,高通的骁龙X系列和苹果的Neural Engine也是类似的设计。将世界模型与NPU结合的愿景是:未来用户无需依赖云端服务器,就能在本地PC上实时运行轻量级的世界模型,实现个人化的三维场景生成、物理模拟和交互体验。
理论上,再过几年去AI里抛硬币,结果应该会比现在均匀得多。
这不仅仅是一个关于硬币的故事,而是关于AI如何从"模仿世界的表象"进化到"理解世界的本质"的深刻转变。这个转变,正在发生。
相关推荐

李飞飞谈AI:视觉智能、创造力边界与人类主体性
斯坦福教授李飞飞在Huberman Lab播客深度解析AI与视觉科学的关系,探讨ImageNet如何引爆现代AI,阐述AI的能力边界、医疗应用前景,以及为何人类主体性是AI发展的核心命题。

DeepSeek Harness实测:插件化Agent框架的核心优势解析
深入实测DeepSeek Harness开源Agent框架,解析其插件化架构设计、编码能力、安装部署方式及与Claude Code的对比,帮助开发者了解这款可扩展Agent开发底座的真正价值。

10美元搭建50万域名搜索引擎:独立开发者的周末项目启示
一位独立开发者仅用一个周末和10美元成本,搭建了覆盖50万域名的垂直搜索引擎。本文深入分析低成本搜索引擎背后的技术栈、垂直搜索的差异化机会,以及独立开发者快速验证想法的方法论。