Bach《Learning Theory from First Principles》共学指南:从零构建机器学习理论

一场关于机器学习数学根基的共学实验
近日,Reddit 上出现了一个颇具号召力的学习社区倡议:一位机器学习爱好者发起了针对 Francis Bach 所著 Learning Theory from First Principles(MIT Press, 2024)的读书共学小组。发起人坦言,这本书虽然出色,但内容密集、证明繁复,独自啃读极为吃力,因此希望聚集一批志同道合的人,通过每周讨论的方式共同攻克其中的数学难点。

这本书的一大优势在于完全免费——作者在其个人网站上公开了 PDF,没有任何经济门槛。这也降低了参与共学的成本,让更多对机器学习理论感兴趣的人能够加入进来。对于当下大量涌入 AI 领域的从业者和学生而言,这种回归数学第一性原理的深度学习方式,恰恰是被浮躁的"调包"文化所忽视的宝贵路径。
Francis Bach 这本书讲了什么?
Learning Theory from First Principles 是 Francis Bach 的一部力作。Bach 是法国国家信息与自动化研究所(INRIA)的资深研究员,也是机器学习优化与核方法领域的权威学者。INRIA(Institut National de Recherche en Informatique et en Automatique)是法国最重要的计算机科学与应用数学研究机构,成立于 1967 年,在欧洲乃至全球的人工智能研究版图中占据核心位置。INRIA 在全法设有多个研究中心,汇聚了数千名研究人员,其研究涵盖从基础算法理论到机器人学、计算生物学等广泛领域,培养了包括图灵奖得主 Gérard Berry 在内的众多杰出科学家。Bach 长期领导 INRIA 的 SIERRA 团队(现已更名为 SIERRA/DI ENS 联合团队,与巴黎高等师范学院合作),专注于凸优化、核方法、稀疏建模等方向,发表论文被引用超过数万次,曾担任 ICML(国际机器学习大会)程序主席。这本书可以看作他二十余年研究经验的系统性理论沉淀,其核心目标是从数学基础出发,系统性地构建监督学习的理论框架。
全书内容脉络
根据发起人的介绍,全书的知识路径循序渐进:
- 起点:从最小二乘法(least squares)与经验风险最小化(empirical risk minimization, ERM)切入,这是理解统计学习的基石。最小二乘法的历史可以追溯到 19 世纪初,由高斯和勒让德各自独立提出,最初用于天文观测数据的拟合,此后成为现代回归分析的基石。经验风险最小化的基本思想是:由于我们无法直接最小化未知的真实风险(即模型在整个数据分布上的期望损失),我们转而最小化在有限训练样本上计算的经验风险作为替代。这一框架的理论根基可以追溯到 Vapnik 和 Chervonenkis 在 1970 年代的开创性工作,他们证明了在一定条件下(如假设空间的 VC 维有限),经验风险的最小化者能够以可控的速率收敛到真实风险的最小化者。ERM 的理论分析涉及一致收敛(uniform convergence)、VC 维(Vapnik-Chervonenkis dimension)等核心工具,这些工具精确刻画了从有限样本中学习的可能性与局限性。理解 ERM 为何有效、在什么条件下失效,是理解整个机器学习理论大厦的起点——从过拟合、正则化到模型复杂度控制,几乎所有关键概念都围绕这一框架展开;
- 优化理论:讨论如何求解学习问题背后的优化过程。优化理论是机器学习的计算引擎——从凸优化中的梯度下降、牛顿法,到非凸优化中的随机梯度下降(SGD)及其变体(Adam、AdaGrad 等),优化算法决定了模型能否在合理时间内找到好的参数。Bach 本人在凸优化领域有深厚积累,他在随机逼近(stochastic approximation)、Frank-Wolfe 算法、以及优化与统计的交汇等方向的贡献为理解大规模机器学习的计算效率提供了重要的理论基础。一个核心议题是:当计算预算有限时,我们是否仍能达到统计最优的学习性能?这种"计算-统计权衡"是当代学习理论最富有挑战性的前沿之一;
- 局部平均方法(local averaging methods):包括 k 近邻等经典非参数方法。这类方法的核心思想是利用"相似的输入应该产生相似的输出"这一朴素直觉,通过对查询点附近的训练样本进行某种加权平均来做出预测。k 近邻算法是最直观的代表:给定一个新的数据点,找到训练集中距离最近的 k 个样本,用它们的标签(或标签的平均)作为预测。尽管思想简单,这类方法的理论分析却非常丰富——Stone 定理(1977)给出了非参数回归一致性的一般条件,而维度灾难(curse of dimensionality)则揭示了这类方法在高维空间中面临的根本性困难:所需样本量随维度指数级增长。理解这些局限性也为理解为何需要参数模型和特征学习提供了动机;
- 核方法(kernel methods):这是 Bach 本人的研究强项,也是连接线性模型与非线性建模的关键桥梁。核方法的核心思想是通过一个核函数隐式地将数据映射到高维(甚至无穷维)特征空间,从而在该空间中使用线性方法解决原始空间中的非线性问题——这就是著名的"核技巧"(kernel trick)。其数学基础是再生核希尔伯特空间(RKHS, Reproducing Kernel Hilbert Space)理论,该理论为函数空间中的学习提供了优雅的数学框架。常用的核函数包括高斯核(RBF 核)、多项式核和拉普拉斯核等,每种核函数对应不同的特征映射和函数空间假设。以支持向量机(SVM)为代表的核方法在 2000 年代曾是机器学习的主流范式,在文本分类、生物信息学等领域取得了巨大成功。虽然深度学习的崛起使核方法在应用层面退居二线,但其理论价值不减反增——近年来的研究揭示了宽神经网络与核方法之间的深刻联系(如神经切线核 NTK 理论,由 Jacot 等人于 2018 年提出),使得核方法的理论框架成为理解深度学习的一把重要钥匙;
- 模型选择(model selection):如何在偏差与方差之间权衡。模型选择涉及交叉验证(cross-validation)、信息准则(如赤池信息准则 AIC、贝叶斯信息准则 BIC)、结构风险最小化(structural risk minimization)等方法论。偏差-方差分解揭示了一个基本张力:过于简单的模型无法捕捉数据中的真实模式(高偏差,即欠拟合),过于复杂的模型则会拟合噪声(高方差,即过拟合)。经典理论预测存在一个最优复杂度的"甜蜜点",交叉验证等方法正是为了找到这个平衡点。然而,正如后续章节将讨论的,过参数化现象对这一经典图景提出了深刻挑战;
- 神经网络:将理论视角延伸至深度学习模型。从理论角度看,神经网络的表达能力可以通过万能逼近定理(universal approximation theorem)来理解——即使是单隐层的足够宽的前馈网络也能以任意精度逼近任何连续函数。然而,表达能力只是故事的一部分;更关键的问题是:为什么基于梯度的训练算法能够高效地找到好的参数?为什么过参数化的网络能够泛化?这些问题驱动了近年来大量的理论研究。
过参数化与 PAC-Bayes 等进阶主题
在后续章节中,本书还触及了当前学术界的前沿议题,包括过参数化模型(overparameterized models)与 PAC-Bayes 框架。
过参数化之谜是深度学习时代最令人困惑的理论问题之一。经典统计学习理论遵循偏差-方差权衡原则:模型过于复杂(参数过多)会导致过拟合,泛化性能下降。然而,现代深度神经网络往往拥有数十亿参数,远超训练样本数量,却依然能够在测试数据上表现优异。Zhang 等人在 2017 年的著名实验尤其令人震惊:他们证明了标准深度网络能够完美拟合随机标签的训练数据(即纯噪声),这说明网络的容量足以记住任何东西,但在面对真实数据时却选择了学习有意义的模式。近年来涌现了多种解释尝试:隐式正则化理论认为梯度下降算法本身会倾向于找到"简单"的解(例如,在线性回归的过参数化情形中,梯度下降收敛到最小范数解);双下降(double descent)现象表明,模型复杂度超过插值阈值后,测试误差可能再次下降而非持续上升——这一发现由 Belkin 等人(2019)系统性地揭示,颠覆了经典的 U 形测试误差曲线;此外,损失景观的几何结构(如高维空间中鞍点而非局部极小值是主要障碍)、神经网络的特殊归纳偏置(如对低频函数的偏好,即"频谱偏置")等也被认为是关键因素。这一领域目前仍是机器学习理论研究最活跃的前沿之一,尚无统一的解释框架。
PAC-Bayes 框架则提供了一种基于贝叶斯视角的泛化界分析工具。PAC-Bayes 是 PAC(Probably Approximately Correct,概率近似正确)学习理论与贝叶斯方法的融合。PAC 学习理论由 Leslie Valiant 于 1984 年提出(他因此获得了 2010 年图灵奖),其基本问题是:需要多少样本才能"大概率"地学到一个"近似正确"的假设?PAC-Bayes 框架最早由 McAllester(1999)和 Catoni 等人发展,将这一问题推广到假设空间上的概率分布。其核心思想是:不是分析单个假设的泛化性能,而是分析假设空间上一个概率分布(后验分布)的期望泛化性能。PAC-Bayes 界的一般形式表明,泛化误差的上界与后验分布和先验分布之间的 KL 散度(Kullback-Leibler divergence,一种衡量两个概率分布差异的非对称度量)成正比——直觉上,如果数据没有迫使你的信念偏离先验太远,那么模型更可能泛化良好。这一框架在深度学习时代重新引起了广泛关注,因为它能够给出比传统 VC 维或 Rademacher 复杂度更紧的泛化界,尤其适用于分析具有随机性的学习算法(如随机梯度下降)。近年来,Dziugaite 和 Roy(2017)等人的工作展示了如何直接优化 PAC-Bayes 界来训练神经网络,将理论工具转化为实际算法。
这些内容表明,这本书并非停留在经典统计学习理论层面,而是努力与现代深度学习的实践对话。
共学模式的设计:轮流主讲与集体研讨
发起人对这个学习小组有着清晰的规划,体现出对高质量讨论的重视。
组织形式
- 每周一次约一小时的线上通话:由某位成员主讲当周的主要结论,然后大家一起梳理不清楚的细节;
- Discord 社区:在两次会议之间提供随时提问和交流的空间。Discord 最初是为游戏社区设计的即时通讯平台,但近年来在学术和技术社区中获得了广泛采用。其频道分区、语音通话、屏幕共享、LaTeX 渲染机器人等功能使其特别适合数学密集型的讨论场景。相比 Slack 的免费版消息数量限制和传统论坛的纯异步性,Discord 在实时协作与异步讨论之间取得了良好平衡。许多知名的机器学习开源项目(如 Hugging Face、EleutherAI)都以 Discord 作为核心社区平台。
这种"轮流主讲 + 集体研讨"的模式,本质上是一种主动学习(active learning)的实践。费曼学习法以诺贝尔物理学奖得主理查德·费曼命名,其核心原则是:如果你不能用简单清晰的语言向他人解释一个概念,说明你并没有真正理解它。这一方法在认知科学中有坚实的理论支撑——"生成效应"(generation effect)研究表明,主动生成信息(如讲解、教授)比被动接收信息能形成更强的记忆编码和更深的概念理解。此外,在向他人解释时,学习者被迫暴露自己理解中的漏洞,这种"元认知监控"(metacognitive monitoring)过程是高效学习的关键机制——它迫使学习者从"我觉得我懂了"转向"我能否精确地复述每一个推理步骤"。在数学密集型的学习场景中,这一方法尤为有效——一个复杂证明的每个步骤是否真正理解,在尝试讲解给他人的过程中会暴露无遗。相比被动阅读,这种方式能显著提升对密集数学内容的吸收效率。
参与门槛与背景要求
发起人明确列出了推荐的背景知识:线性代数、概率论,以及阅读数学证明的舒适度。说个细节,他特别强调"你不需要理论背景,只需要愿意沉下心来面对细节"。这一表述颇为中肯——学习理论的门槛不在于是否修过相关课程,而在于是否具备耐心与钻研的意愿。事实上,线性代数和概率论是机器学习理论的两根支柱:前者提供了处理高维数据和模型参数的语言(矩阵分解、特征值分析、投影、奇异值分解等),是理解从主成分分析到神经网络权重矩阵的基础;后者则是理解统计估计、泛化误差和不确定性量化的基础,涉及大数定律、中心极限定理、集中不等式(concentration inequalities)等核心工具。集中不等式在学习理论中尤为重要——如 Hoeffding 不等式、Bernstein 不等式和 McDiarmid 不等式等,它们精确量化了随机变量偏离其期望的概率,是推导泛化界的关键数学工具。具备这两项基础加上阅读形式化证明的能力(即理解"对所有 ε > 0,存在 N 使得……"这类数学语言),就足以进入学习理论的大门。
为什么这样的机器学习理论共学值得关注?
在 AI 技术日新月异的今天,大量学习资源集中于工程实践与工具应用,而对底层数学理论的系统性学习却常常被边缘化。然而,正如这本书的标题所暗示的——"from first principles"(从第一性原理出发)——真正深入理解机器学习为何有效、何时失效,离不开对这些数学根基的把握。
"第一性原理"思维源自物理学,最早可追溯到亚里士多德,指的是从最基本的公理和假设出发进行推理,而非依赖类比或经验规则。这一思维方式在现代被 SpaceX 创始人埃隆·马斯克等人推广到工程和商业领域,但其在科学中的传统远比这更深远。在机器学习语境下,这意味着不是仅仅知道"增大数据集能提升性能"或"正则化能防止过拟合"这样的经验法则,而是理解为什么这些方法有效——样本复杂度与假设空间复杂度之间的精确关系是什么?(这涉及 VC 理论和 Rademacher 复杂度等数学工具。)正则化在优化目标中引入了怎样的几何约束?(例如,L1 正则化倾向于产生稀疏解,这可以从 L1 球的几何形状——高维空间中的超八面体——在坐标轴上的"尖角"来直观理解。)泛化界的证明依赖于哪些概率不等式?这种深层理解赋予从业者在面对新问题时从底层构建解决方案的能力,而非仅仅套用现有工具。
小规模学习社区的价值
发起人计划将小组规模控制在五到十人,理由是"要小到足以让讨论真正发挥作用"。这一考量相当务实。过大的学习群组往往流于形式,活跃者寥寥;而一个规模适中、成员投入度高的小组,更容易形成持续的学习动力和深度的思想碰撞。
从学习科学的角度来看,这个规模选择也有其合理性。教育研究中的"邓巴数"概念——由人类学家罗宾·邓巴提出,指人类能够维持稳定社交关系的认知上限约为 150 人——以及小组动力学研究都表明,五到八人是进行深入技术讨论的最佳规模。哈佛大学教育学家 Eric Mazur 在其"同伴教学法"(Peer Instruction)研究中也发现,小组讨论在概念理解方面的效果远超传统讲授。在数学理论学习的具体场景中,这一规模足够多样以带来不同视角和互补技能(有人数学功底更强,有人编程实现经验更丰富,有人可能有应用领域的直觉),又足够小以确保每个人都有充分的发言机会和参与感,避免"搭便车"效应。不同成员对同一个证明可能有不同的理解角度——有人从几何直觉入手,有人擅长代数操作,有人善于构造反例——这种多元视角的碰撞往往能催生比任何个人独学更深刻的理解。
开放与免费的知识共享
值得再次强调的是,本书 PDF 由作者免费公开。这体现了学术界日益增长的开放共享精神——顶尖学者愿意将自己多年的研究结晶无偿分享给全球学习者。这种做法延续了机器学习领域一直以来的开放传统:从 arXiv 预印本文化(arXiv 由物理学家 Paul Ginsparg 于 1991 年创立,最初服务于高能物理社区,后扩展到计算机科学等领域,如今机器学习领域的重要论文几乎都会在正式同行评审前先在 arXiv 上发布),到 Coursera 上 Andrew Ng 的免费课程(2012 年上线,至今已有数百万学习者完成),再到 Goodfellow、Bengio 和 Courville 免费公开的 Deep Learning 教材(俗称"花书",已成为深度学习领域引用最多的教科书之一),这个领域始终保持着较高的知识可及性。这种开放文化部分源于计算机科学的黑客伦理传统,部分也得益于互联网的传播便利性。Bach 选择通过 MIT Press 出版但同时提供免费 PDF,兼顾了学术出版的严肃性(MIT Press 的同行评审保证了内容质量)和知识传播的普惠性。结合免费的 Discord 社区,这个共学项目几乎实现了零成本的高质量机器学习理论学习机会。
如何参与这个共学项目
感兴趣的读者可以在 Reddit 原帖下评论或私信发起人,说明自己的大致时区和能够投入的时间。当人数足够时,发起人将正式建立小组并提出时间安排。Discord 邀请链接也已在帖中公开。
对于希望夯实机器学习理论基础的人来说,这不失为一个难得的机会——既有优质教材,又有共学伙伴,还有结构化的推进节奏。在这个人人追逐大模型热点的时代,静下心来与一群人一起研读证明、推导公式,或许正是通往真正专业能力的必经之路。当前工业界对 AI 人才的需求正在从"会调用 API"转向"理解底层原理"——能够从第一性原理出发分析和设计算法的人才,在大模型训练优化(如理解学习率调度为何有效、损失函数景观的性质)、新架构设计(如从理论角度分析注意力机制的表达能力)、可靠性评估(如为模型的泛化性能提供理论保证而非仅靠经验测试)等核心岗位上拥有不可替代的竞争力。
核心要点
相关推荐

Agent记忆系统实战:长期记忆架构设计与落地方案
深入解析智能体Agent记忆系统的架构设计,涵盖大模型上下文与记忆的区别、短期记忆与长期记忆分层策略、动态注入机制及总结压缩方法,帮助开发者构建能真正「记住用户」的AI智能体。

AI模型迭代速度有多快?10小时就成"熊市"
AI模型迭代速度快到令人瞠目结舌,一个模型从最先进到过时可能只需几小时。本文分析AI模型快速迭代的原因、对开发者和企业的影响,以及如何理性应对这种技术加速度。

AI产品界面重复标签失误:细节质量为何不容忽视
某AI产品界面将Claude Sonnet 5重复列出两次,这一低级失误引发社区热议。本文从迭代压力、配置管理角度分析原因,并分享AI产品UI质量把控的实用经验。