完美世界模型也打不赢卡尔森:AI预测与决策的鸿沟

完美的世界模型只能预测未来,距离真正的决策与控制能力仍有本质差距。
AI研究者Alexander Mattick指出,能够准确预测环境演化的世界模型,并不等同于在复杂场景中做出最优决策的能力——这两者之间存在本质鸿沟。当前世界模型所处理的任务从控制角度看并不困难,其能力容易被高估。人形机器人热衷展示后空翻而非日常取物,正是因为接触密集型操作任务在建模与数据采集上极度困难,高精度触觉感知至今仍是未攻克的关键瓶颈。这为AI与机器人领域的能力评估提供了一个重要的"去噱头"视角:真正的突破应体现在复杂、非结构化、接触密集场景下的实际控制表现,而非炫技式的演示动作。
完美的世界模型,为何仍不够?
AI研究者Alexander Mattick抛出了一个颇具挑战性的观点:即便给你一个关于国际象棋的完美世界模型,你依然无法解出它,也依然成不了马格努斯·卡尔森(Magnus Carlsen)。这背后隐藏着一个常被低估的区别——能够预测未来,和能够推断出正确的行动,是两件完全不同的事情。
世界模型(World Model)近年来成为AI领域的热门方向,其核心是让模型学会预测环境在给定行动下的演化。然而Mattick指出,拥有一个能准确预测结果的模型,并不等于拥有在复杂局面中做出最优决策的能力。象棋的规则是完全已知的、确定性的,但真正下赢对手需要的是在庞大搜索空间中进行高质量推断(inference)的能力,而非仅仅是模拟棋盘状态的能力。

这个区分之所以重要,是因为它触及了当前AI能力边界的本质:预测是关于"会发生什么",而决策是关于"我应该做什么"。两者之间横亘着一条远比表面看起来更宽的鸿沟。
世界模型(World Model)的概念可追溯至David Ha与Jürgen Schmidhuber在2018年的同名论文,其核心思想是让智能体在内部维持一个对外部环境的压缩表示,并用这个表示来"想象"不同行动的后果,从而在不与真实环境交互的情况下规划行为。Yann LeCun近年来大力倡导的"Joint Embedding Predictive Architecture(JEPA)"也属于这一思路的延伸。世界模型被寄予厚望,部分原因在于它似乎提供了一条通往"理解"的路径——如果模型能准确预测物理世界的演化,是否意味着它对世界有某种深层理解?Mattick的论点正是对这种直觉的纠偏:预测精度(prediction accuracy)与策略质量(policy quality)在理论上是相互独立的目标,前者是监督学习问题,后者本质上是一个搜索与优化问题。即便在模型完美的假设下,如何在指数级爆炸的决策树中高效地找到最优路径,依然是一个独立且极其困难的计算挑战。
为什么现有世界模型任务"看起来"很强
Mattick认为,世界模型目前展现出的能力被高估了,很大程度上是因为当下用世界模型处理的任务,从控制(control)的角度来看并不算困难。
换句话说,许多演示场景的决策复杂度其实有限。模型在这些相对规整、可预测的环境中表现亮眼,容易让人产生"世界模型已经很强大"的错觉。但一旦任务涉及真实世界中高度复杂、接触密集的控制问题,差距就会暴露出来。

这提醒我们在评估AI进展时需要更谨慎:一个系统能在受控环境里完成炫目的任务,并不代表它掌握了可泛化的决策与控制能力。预测精度与行动能力之间,不能简单画等号。
机器人为何只会"后空翻"却不会取牛奶
Mattick用了一个极具说服力的例子来说明这一点。你会看到来自中国、美国、德国等各国的人形机器人不断展示后空翻、冲刺奔跑这样的动作,但你几乎看不到它们完成这样一个简单任务:站起来,走到隔壁房间,打开冰箱,看看里面深处,拿出一盒牛奶递给我。

原因并非机器人"不想"做这种日常任务,而是这类任务实际上要难得多。后空翻和奔跑虽然看起来惊险,但本质上是相对结构化、可预先规划的动作序列。而取牛奶这个任务涉及接触密集的环境(contact-rich environment)——手指与物体的精细接触、力的控制、对柔软或不规则物体的操作。

Mattick特别指出,当前仍然缺乏真正优秀的**高精度触觉感知(high tactile sensing)**手段。接触密集的操作既难以建模,也难以采集数据——你无法像录制视频那样轻松地获取大量高质量的触觉交互数据。这正是日常操作任务迟迟难以攻克的核心瓶颈。
接触密集型任务(contact-rich manipulation)之所以构成机器人学的核心难题,在于接触本身带来的物理不连续性。当手指夹住一个物体时,系统的动力学方程在接触点发生突变——力的方向、摩擦系数、物体形变都在毫秒级时间内剧烈变化,传统的基于微分方程的控制方法很难优雅地处理这类"混合系统"。相比之下,后空翻属于"无接触"或"单一接触点"的弹道运动,物理方程在整个过程中保持相对连续,更易于通过强化学习或轨迹优化来求解。触觉传感器的不成熟进一步加剧了这一困境:现有商业触觉传感器(如GelSight、DIGIT等基于视触觉原理的方案)虽然取得了进展,但在耐用性、空间分辨率和实时信号处理上仍远落后于人类皮肤。数据匮乏的问题同样棘手——互联网上存在海量视频可供视觉模型学习,但高质量的触觉交互数据至今没有可比规模的公开数据集,这使得以数据驱动为核心的现代机器学习方法在这一领域先天受限。
对AI发展的启示
这番论述揭示了一个重要的产业现实:炫技式的机器人演示与真正实用的日常操作之间,存在巨大的技术代差。能后空翻的机器人未必能帮你从冰箱里拿东西,正如拥有完美象棋模型的系统未必能战胜顶级棋手。
核心矛盾可以归纳为几点:预测能力不等于决策能力;受控环境的成功不代表真实世界的能力;而接触密集型任务的建模与数据采集,仍是横在具身智能面前的硬骨头。
对于关注AI与机器人领域的人来说,这是一个有价值的"去噱头"视角——评判进展时,与其被炫目的动作吸引,不如关注系统在复杂、非结构化、接触密集场景中的实际推断与控制表现。真正的突破,往往藏在那些看起来"平平无奇"的任务里。
相关推荐

语音识别远未解决:Mistral音频研究负责人深度解析
Mistral AI音频研究负责人Pavan Kumar Reddy深度解析语音识别为何远未解决:从Voxtral模型架构、连续隐变量生成、流式与批量权衡、说话人分离难题到DPO修复幻觉,以及语音技术在真实企业场景的落地短板。

AI权重可被复制,为何反而扼杀了创造力?
AI模型权重可被随意复制,这种开放权重的无约束特性反而削弱了创造力。本文解析复制为何是反模式、约束如何催生新颖,以及"约束工程师"这一正在浮现的新角色。

NVIDIA Cosmos解析:物理AI如何打通语言、视频与动作
NVIDIA研究负责人Ming-Yu Liu深度解析Cosmos物理AI世界模型:如何用单一架构打通语言、视频、音频与动作,涵盖自回归塔与扩散塔协作、多模态时间对齐、策略验证仿真及Super/Nano/Edge三种开源模型。