[控场AI]
· 5 分钟阅读· 2,580 字

完美世界模型也打不赢卡尔森:AI预测与决策的鸿沟

完美世界模型也打不赢卡尔森:AI预测与决策的鸿沟

完美的世界模型只能预测未来,距离真正的决策与控制能力仍有本质差距。

AI研究者Alexander Mattick指出,能够准确预测环境演化的世界模型,并不等同于在复杂场景中做出最优决策的能力——这两者之间存在本质鸿沟。当前世界模型所处理的任务从控制角度看并不困难,其能力容易被高估。人形机器人热衷展示后空翻而非日常取物,正是因为接触密集型操作任务在建模与数据采集上极度困难,高精度触觉感知至今仍是未攻克的关键瓶颈。这为AI与机器人领域的能力评估提供了一个重要的"去噱头"视角:真正的突破应体现在复杂、非结构化、接触密集场景下的实际控制表现,而非炫技式的演示动作。

完美的世界模型,为何仍不够?

AI研究者Alexander Mattick抛出了一个颇具挑战性的观点:即便给你一个关于国际象棋的完美世界模型,你依然无法解出它,也依然成不了马格努斯·卡尔森(Magnus Carlsen)。这背后隐藏着一个常被低估的区别——能够预测未来,和能够推断出正确的行动,是两件完全不同的事情。

世界模型(World Model)近年来成为AI领域的热门方向,其核心是让模型学会预测环境在给定行动下的演化。然而Mattick指出,拥有一个能准确预测结果的模型,并不等于拥有在复杂局面中做出最优决策的能力。象棋的规则是完全已知的、确定性的,但真正下赢对手需要的是在庞大搜索空间中进行高质量推断(inference)的能力,而非仅仅是模拟棋盘状态的能力。

being able to actually make inferences

这个区分之所以重要,是因为它触及了当前AI能力边界的本质:预测是关于"会发生什么",而决策是关于"我应该做什么"。两者之间横亘着一条远比表面看起来更宽的鸿沟。

世界模型(World Model)的概念可追溯至David Ha与Jürgen Schmidhuber在2018年的同名论文,其核心思想是让智能体在内部维持一个对外部环境的压缩表示,并用这个表示来"想象"不同行动的后果,从而在不与真实环境交互的情况下规划行为。Yann LeCun近年来大力倡导的"Joint Embedding Predictive Architecture(JEPA)"也属于这一思路的延伸。世界模型被寄予厚望,部分原因在于它似乎提供了一条通往"理解"的路径——如果模型能准确预测物理世界的演化,是否意味着它对世界有某种深层理解?Mattick的论点正是对这种直觉的纠偏:预测精度(prediction accuracy)与策略质量(policy quality)在理论上是相互独立的目标,前者是监督学习问题,后者本质上是一个搜索与优化问题。即便在模型完美的假设下,如何在指数级爆炸的决策树中高效地找到最优路径,依然是一个独立且极其困难的计算挑战。

为什么现有世界模型任务"看起来"很强

Mattick认为,世界模型目前展现出的能力被高估了,很大程度上是因为当下用世界模型处理的任务,从控制(control)的角度来看并不算困难。

换句话说,许多演示场景的决策复杂度其实有限。模型在这些相对规整、可预测的环境中表现亮眼,容易让人产生"世界模型已经很强大"的错觉。但一旦任务涉及真实世界中高度复杂、接触密集的控制问题,差距就会暴露出来。

are not that difficult from a control point of view

这提醒我们在评估AI进展时需要更谨慎:一个系统能在受控环境里完成炫目的任务,并不代表它掌握了可泛化的决策与控制能力。预测精度与行动能力之间,不能简单画等号。

机器人为何只会"后空翻"却不会取牛奶

Mattick用了一个极具说服力的例子来说明这一点。你会看到来自中国、美国、德国等各国的人形机器人不断展示后空翻、冲刺奔跑这样的动作,但你几乎看不到它们完成这样一个简单任务:站起来,走到隔壁房间,打开冰箱,看看里面深处,拿出一盒牛奶递给我。

just stand up, go into the next room

原因并非机器人"不想"做这种日常任务,而是这类任务实际上要难得多。后空翻和奔跑虽然看起来惊险,但本质上是相对结构化、可预先规划的动作序列。而取牛奶这个任务涉及接触密集的环境(contact-rich environment)——手指与物体的精细接触、力的控制、对柔软或不规则物体的操作。

or American, German, whatever

Mattick特别指出,当前仍然缺乏真正优秀的**高精度触觉感知(high tactile sensing)**手段。接触密集的操作既难以建模,也难以采集数据——你无法像录制视频那样轻松地获取大量高质量的触觉交互数据。这正是日常操作任务迟迟难以攻克的核心瓶颈。

接触密集型任务(contact-rich manipulation)之所以构成机器人学的核心难题,在于接触本身带来的物理不连续性。当手指夹住一个物体时,系统的动力学方程在接触点发生突变——力的方向、摩擦系数、物体形变都在毫秒级时间内剧烈变化,传统的基于微分方程的控制方法很难优雅地处理这类"混合系统"。相比之下,后空翻属于"无接触"或"单一接触点"的弹道运动,物理方程在整个过程中保持相对连续,更易于通过强化学习或轨迹优化来求解。触觉传感器的不成熟进一步加剧了这一困境:现有商业触觉传感器(如GelSight、DIGIT等基于视触觉原理的方案)虽然取得了进展,但在耐用性、空间分辨率和实时信号处理上仍远落后于人类皮肤。数据匮乏的问题同样棘手——互联网上存在海量视频可供视觉模型学习,但高质量的触觉交互数据至今没有可比规模的公开数据集,这使得以数据驱动为核心的现代机器学习方法在这一领域先天受限。

对AI发展的启示

这番论述揭示了一个重要的产业现实:炫技式的机器人演示与真正实用的日常操作之间,存在巨大的技术代差。能后空翻的机器人未必能帮你从冰箱里拿东西,正如拥有完美象棋模型的系统未必能战胜顶级棋手。

核心矛盾可以归纳为几点:预测能力不等于决策能力;受控环境的成功不代表真实世界的能力;而接触密集型任务的建模与数据采集,仍是横在具身智能面前的硬骨头。

对于关注AI与机器人领域的人来说,这是一个有价值的"去噱头"视角——评判进展时,与其被炫目的动作吸引,不如关注系统在复杂、非结构化、接触密集场景中的实际推断与控制表现。真正的突破,往往藏在那些看起来"平平无奇"的任务里。

分享:

相关推荐