为什么更多数据无法替代先验结构:Alexander Mattick深度访谈

Alexander Mattick系统论证"约束与先验结构"比堆砌数据更有价值,贯穿推理演化史、能量模型、深度学习理论与约束强化学习。
德国纽伦堡技术大学研究者Alexander Mattick在MLST播客的深度访谈中,从数学推理史出发,系统反驳了"数据与算力万能论"。他的核心论点是:信息极其昂贵,先验结构与约束往往比单纯增加数据更有价值。他梳理了推理方法从变分推理、MCMC、能量模型到扩散模型与流匹配的演化脉络,将其理解为不断"摊销"昂贵采样成本的历史。他认为能量模型本质仍是生成式的、只是代价高昂,已不再实用;JEPA与世界模型在很大程度上是品牌化术语,缺乏真正的概念边界。在深度学习理论上,他偏向函数视角而非参数视角。在博士研究方向约束强化学习中,他强调约束带来的可沟通性与可组合性优势,并指出基于采样的RL无法提供最坏情况保证,是真实世界落地的根本障碍。
在机器学习圈子里流传着一种信念:只要数据足够多、算力足够强,模型就能学会一切。但德国纽伦堡技术大学的研究者 Alexander Mattick(在 Yannick Kilcher 的 Discord 上以 "Zixag" 著称)在 MLST 播客的这期深度访谈中,系统性地反驳了这一观点。他从推理(inference)的数学史出发,一路谈到能量模型、扩散模型、深度学习理论、约束强化学习与世界模型,核心论点始终如一:信息是昂贵的,而先验结构(约束)往往比堆砌数据更有价值。
信息昂贵:为什么约束不可或缺
Mattick 的立场鲜明:"信息可能非常昂贵,事实上我会说大多数信息都极其昂贵。" 如果你完全放弃约束、拒绝编码任何先验知识,那么你就面临着"需要从零开始重新学习一切"的问题。
这直接挑战了 Rich Sutton 的两个著名论断——"奖励就足够了"(Reward is Enough)与"苦涩的教训"(The Bitter Lesson)。Sutton 认为可以为每个任务设计合适的奖励函数,不需要研究那些复杂的东西。Mattick 承认这在"极限意义上"是成立的——理论上你确实可以为几乎任何问题定义一个奖励函数。但他认为这是一种"极度浪费的世界观"。

他举了一个极具说服力的实例:OpenAI 5(打 Dota 的 AI)的论文附录里有一张巨大的表格,左边列着奖励函数的各种属性,中间则是一堆看似随机的权重数字。"如果你告诉我有办法真正推导出这些数字,那是不可能的。" 更关键的是,这些奖励函数里实际上藏着大量约束——比如"在错误路线上停留过久会得到负奖励",这本质就是一个约束,只是被硬塞进了奖励函数的框架里。
推理的演化史:从拒绝采样到流匹配
访谈的技术主干是一部清晰的推理方法演化史。Mattick 把这条轨迹描述为一个不断"摊销"(amortize)昂贵采样成本的过程:
- 变分推理:用参数化的归一化密度(如正态分布)拟合数据,但受限于密度形式,遇到双峰分布就只能"把质量堆在中间"。
- 拒绝采样与 MCMC:无需知道密度本身,只靠采样和拒绝就能工作,但在高维下遭遇维度诅咒,速度极慢。
- 能量模型(EBM):直接源自 MCMC,用能量函数参数化未归一化密度。训练便宜(无需计算复杂积分),但采样昂贵——最贵的部分在推理时被反复执行,而非在训练时摊销。
- 扩散模型:引入"无限潜变量",把问题重新表述为随机微分方程,用向量场替代接受-拒绝步骤,代价是多了一个时间维度。
- 流匹配(Flow Matching)/ 连续归一化流:把寻找密度表述为纯优化问题,彻底摆脱采样,只需为可逆性付出代价。
Mattick 的关键洞见是:"大多数深度学习其实都在做推理。" 无论是语言模型的自回归分解,还是用均方误差做回归(本质是固定标准差的正态分布下的负对数似然),都是推理的不同形式。
**摊销(Amortization)**在这里是一个核心概念,值得单独解释。在统计推理中,"摊销"指的是把每次推理时都需要重复执行的昂贵计算,提前"预付"到训练阶段,从而使推理时的边际成本大幅降低。能量模型的问题正在于它没有摊销:每次你想从模型中采样,都必须运行完整的MCMC链,代价极高。扩散模型和流匹配则通过训练一个神经网络来"记住"如何从噪声生成数据,把采样的成本一次性消化在训练里,推理时只需前向传播。这个视角也解释了为什么语言模型的自回归解码本质是推理:它实际上是在用已训练好的参数化分布,逐步对序列进行摊销式的后验采样。
能量模型是否已经过时?
这是访谈中最具争议的部分。Yann LeCun 一直推崇能量模型,并认为它们"不是生成式的"因而更优。Mattick 对此直接反驳:"我不太理解能量模型不是生成式的这种说法……从根本上说它们依然是生成式的,只是非常昂贵,所以没人这么用。"

他的判断更为尖锐:"我认为能量模型并不真的有用,至少不再有用了。" 当然存在例外——比如物理场景(能量函数天然存在),或者当你只需要"比值"(判断一个点比另一个点可能性高多少)而不需要绝对分数时。但在绝大多数问题上,如果你要做生成,扩散模型或流匹配更好;如果你要做自监督学习,能量模型是一种过于宽泛、因而缺乏信息量的表述方式。

同样的"品牌化"批评也落在了 JEPA 身上。Mattick 指出:"在 JEPA 之前就有 JEPA 式的模型。" 他甚至直言,如果 DINO 今天发布,人们会把它叫作 JEPA 架构,因为这个术语的定义过于开放。关于对比学习与非对比学习的分歧,他认同 LeCun 的方向——对比性本身不足以学到有用模型,应该转向映射到紧致潜在空间的思路(如变分自编码器及其后继者)。
JEPA(Joint-Embedding Predictive Architecture)是Yann LeCun团队近年主推的自监督学习框架,核心思想是在潜在空间(而非像素空间)中做预测:给定输入的一部分,模型预测另一部分的表征而非原始内容,从而避免生成模型在像素级重建上的资源浪费。LeCun认为这比对比学习更本质,因为它不依赖负样本,同时比生成式模型更高效。Mattick的批评针对的是这一术语的边界模糊性:JEPA的定义宽泛到几乎可以覆盖所有在嵌入空间做预测的模型,包括更早的DINO、BarlowTwins等,使之更像一种事后命名框架而非真正的架构创新。这与他对"世界模型"的批评一脉相承——当一个术语的定义足够宽,它的区分能力就趋近于零,反而可能掩盖真正重要的技术差异。
深度学习理论:参数视角 vs 函数视角
面对层出不穷的"深度学习理论",Mattick 将其大致分为两类。参数视角把神经网络看作巨大的非线性优化问题,关注收敛性、全局最优、样条区域等。函数视角(如神经正切核理论、平均场理论)则把网络视为函数空间中的对象,在大规模极限下,单个参数的变化不再有意义,重要的是整体"场"的变化——这类似于物理学中用宏观性质而非单个粒子来描述水流。
他倾向于函数视角,因为它更好地解释了"过参数化"现象:一个十亿参数的函数,比五十参数的函数更接近真实函数空间。但他也坦诚:真正好的深度学习理论的标准应当是"能做出正确的预测并经得起证伪",而当前整个领域的问题在于"我们连一篇延续性工作里有没有实现 bug 都判断不出来"——他本人就曾花三个月才发现一个实现 bug。这本身就说明理论尚未成熟。
关于流形假设(Manifold Hypothesis),他的态度同样谨慎:"我不认为它是对的,也不认为它是错的,我认为即使它是对的,它也不是思考问题的有用方式。" 他对可解释性技术的鲁棒性持怀疑态度,认为很多方法都建立在沉默的简化假设之上。
**神经正切核(Neural Tangent Kernel,NTK)**是函数视角的代表性理论工具。其核心结论是:当神经网络宽度趋向无穷时,网络在梯度下降训练过程中的行为等价于一个以NTK为核函数的核回归模型,网络参数几乎不移动("懒训练"),学习完全由初始化时的函数空间结构决定。这一结论的意义在于:它把一个难以分析的非线性优化问题映射到了线性化的函数空间,使收敛性等问题变得可以精确刻画。然而NTK理论的主要批评也正在于此——真实网络并非无限宽,且特征学习(feature learning)恰恰是深度学习强大的来源,而NTK框架下网络不做特征学习。Mattick对函数视角的偏好,部分正是因为它能容纳特征学习这一现实,而不像NTK那样在极限假设下把最有趣的现象消去。
约束强化学习与世界模型的现实边界
作为 Mattick 的博士研究方向,约束强化学习(Constrained RL)体现了他对"约束优于调参"的信念。相比在奖励函数里调整权重,显式建模约束带来两大优势:可沟通性(工程师更容易谈论约束而非权重)与可组合性(新增一个约束不会迫使你重新调校所有权重,因为拉格朗日系数会自动调整)。
他特别强调深度强化学习无法提供 L-无穷(最坏情况)保证——因为一切基于采样,而采样与绝对最大误差天然不兼容。一个在期望意义上完美、却有一次灾难性失败的控制器,和一个始终轻微游移的控制器在期望上是一样的。这正是现实世界部署的致命问题。
对于火热的"世界模型"概念,Mattick 认为它和 JEPA 一样是"品牌化"的产物:"在世界模型之前就有世界模型。" Schmidhuber 的原始世界模型论文本质就是基于模型的强化学习。他提出一个实用区分:如果数据收集在循环内,叫基于模型的 RL;如果在循环外,叫世界模型。
他对世界模型落地的态度冷静而犀利。针对 LeCun "有了完美世界模型就不需要 RL" 的说法,他反驳:"我可以给你一个完美的国际象棋世界模型,你依然赢不了 Magnus Carlsen。" 能预测未来和能推断出正确动作之间存在鸿沟。更根本的问题在于真实世界的可靠性要求:"如果你去宝马说我的机器人 90% 的时间做对、10% 做错,他们会说我不会花这个钱。" 这些方法"被设置成在 demo 里看起来很漂亮",但"你怎么知道它失败了多少次?"
**约束强化学习(Constrained RL)**的数学基础是约束马尔可夫决策过程(Constrained MDP,CMDP),它在标准MDP的基础上增加了若干成本函数,要求策略在最大化累积奖励的同时,将每种成本的期望累积值控制在给定阈值以下。求解CMDP的常用方法是拉格朗日松弛:将约束以乘子形式加入目标函数,使原问题转化为一个无约束的对偶优化问题,而拉格朗日乘子本身会在训练中自动调整以满足约束。这正是Mattick所说"可组合性"的来源——新增一个约束只需引入新的乘子,现有乘子会在优化中重新均衡,而不必手工重新调整所有奖励权重。然而他同时指出,基于采样的RL在本质上只能提供期望意义上的保证,无法覆盖最坏情况(L-无穷范数),这在安全关键场景下是根本性局限。
约束即自由
访谈引用了达芬奇的名言——约束给予我们自由。Mattick 将抽象层级类比为控制系统:底层提供保证(不变量),上层据此构建能力。这也是分层强化学习从未真正成功的原因——底层无法为上层提供足够的保证。好的抽象与坏的抽象的区别,归根结底在于其"有用性":我们只看到成功的抽象,而大量本可能很有价值的抽象,仅仅因为没被合适的人拾起就被遗忘了。
这期访谈的价值在于,它没有停留在对某个具体模型的追捧或贬低,而是贯穿始终地追问一个更本质的问题:在数据与算力狂飙的时代,我们究竟还需不需要人类编码的结构与知识?Mattick 的答案清晰而坚定——需要,而且非常需要。
相关推荐

无GPU也能跑大模型?老旧DDR3服务器的本地推理性价比探讨
一场Reddit讨论探讨了无GPU本地部署大模型的可行性:用老旧DDR3多路服务器靠内存带宽跑Qwen 3.8 Flash,以及4bit量化、KV缓存与上下文长度的实用权衡与电费成本争议。

拓扑域外泛化:让AI预测系统从未见过的动力学突变
NeurIPS论文提出拓扑域外泛化方法,通过特征分离与物理稀疏先验修复分层DSR模型缺陷,使AI能在不知控制参数的情况下预测系统分岔与动力学突变,适用于PLRNN和Neural ODE。

用不好AI Agent是你的错吗?破解AI工具焦虑的实用指南
用不好AI Agent是你的能力问题吗?本文从产品成熟度、使用预期和场景匹配三个角度剖析AI工具使用困境,提供破解AI焦虑的实用方法与选型建议。