机器学习统计学基础:从MLE到EWMA深度学习优化器原理

为什么统计学是机器学习的基石
在机器学习的众多数学基础中,统计学往往是最容易被初学者忽视,却又最为核心的一环。近日,一位内容创作者在 Reddit 上分享了其《机器学习统计学》系列教程的第二部分,长达约两小时,采用白板手写推导的方式,从零开始构建统计学在 AI/ML 中的核心概念。
这套教程的价值在于,它并非停留在公式的堆砌,而是通过详细的数学推导和可视化解释,帮助学习者真正理解算法背后的原理。对于希望深入理解模型工作机制、而非仅仅调用 API 的从业者而言,这类内容尤为珍贵。

最大似然估计MLE:从单变量到多变量高斯推导
本期内容的核心之一,是**最大似然估计(Maximum Likelihood Estimation, MLE)**的完整推导。MLE 是参数估计中最基础也最重要的方法,它回答了一个根本问题:给定观测数据,什么样的模型参数最有可能产生这些数据?
从历史角度看,MLE 由英国统计学家 R.A. Fisher 在 1920 年代系统提出,是频率学派统计推断的核心方法。其基本思想是:将观测数据视为固定的,将参数视为未知量,通过最大化似然函数来寻找最优参数。MLE 具有多项优良的渐近性质——当样本量趋于无穷时,MLE 估计量具有一致性(收敛到真实参数)、渐近正态性和渐近有效性(达到 Cramér-Rao 下界)。
这里有必要解释一下 **Cramér-Rao 下界(CRLB)**这一重要概念。CRLB 是统计估计理论中的一个基本结果,它给出了任何无偏估计量方差的下限。具体而言,对于参数 θ 的任何无偏估计量,其方差不小于 Fisher 信息量的倒数:Var(θ̂) ≥ 1/I(θ)。Fisher 信息量 I(θ) 衡量数据携带的关于参数的信息量——直观地理解,当似然函数在最优参数附近越"尖锐",Fisher 信息量越大,意味着数据提供了更多关于参数的信息,估计的精度上限也越高。当一个估计量的方差恰好等于 CRLB 时,称其为有效估计量。MLE 在大样本下达到这一下界,意味着它在渐近意义上是最优的——没有其他无偏估计量能在方差上做得更好。
这些性质使 MLE 在机器学习中被广泛采用,从逻辑回归到神经网络的训练目标函数设计,几乎都可以追溯到 MLE 框架。
教程首先从单变量高斯分布入手,推导其均值和方差的最大似然估计。这一过程相对直观,通过对似然函数取对数、求导并令导数为零,即可得到我们熟悉的样本均值与样本方差公式。
值得一提的是,高斯分布(正态分布)之所以在统计学和机器学习中占据核心地位,不仅因为中心极限定理保证了大量独立随机变量之和趋近于正态分布,还因为它是最大熵分布——在给定均值和方差约束下,正态分布是信息量最少(即最不确定)的分布。因此,当我们只知道数据的均值和方差而缺乏其他信息时,选择高斯分布作为建模假设是最保守、最合理的选择,这为它在机器学习中的广泛应用提供了信息论层面的理论支撑。
多变量高斯分布的可视化理解
真正的难点在于多变量高斯分布的 MLE 推导。这里教程引入了两个关键概念——散布矩阵(Scatter Matrix)和中心化矩阵(Centering Matrix),并通过可视化方式帮助理解。
多变量情形下,协方差矩阵的估计涉及矩阵求导,这对许多学习者而言是一道门槛。这里需要用到矩阵微积分(matrix calculus),这是标量微积分向矩阵空间的推广。核心工具包括:对矩阵的迹(trace)求导、行列式的对数求导(∂log|A|/∂A = A⁻ᵀ)、以及利用迹的循环置换性质简化推导。这些技术在机器学习中无处不在,从 PCA 的推导到神经网络的反向传播算法,都依赖矩阵求导的基本规则。掌握这套工具是理解多变量统计推导的前提。
散布矩阵定义为 S = Σ(xi - x̄)(xi - x̄)ᵀ,它是协方差矩阵的未归一化版本,在主成分分析(PCA)和 Fisher 线性判别分析(LDA)中同样扮演核心角色。中心化矩阵 H = I - (1/n)11ᵀ 是一个幂等矩阵(即 H² = H),其作用是将任意数据矩阵 X 投影到均值为零的子空间上。通过中心化矩阵,散布矩阵可以紧凑地表示为 S = XᵀHX,这种矩阵表达不仅简化了推导过程,还揭示了数据中心化操作的几何本质——它是一种正交投影。将这些概念可视化,能够让抽象的矩阵运算变得直观可感。
从统计学到线性回归:MLE与最小二乘法的等价性
教程随后将 MLE 应用于线性回归,并推导出残差平方和(Residual Sum of Squares, RSS)。这一环节揭示了一个深刻的联系:在假设误差服从高斯分布的前提下,线性回归的最大似然估计与最小二乘法在数学上是等价的。
这种等价性依赖于一个关键假设:观测噪声服从均值为零的高斯分布。如果改变噪声假设,损失函数也会相应改变。例如,假设噪声服从拉普拉斯分布,MLE 将导出 L1 损失(绝对值损失),对应的回归方法称为最小绝对偏差回归(LAD),它对异常值更加鲁棒。假设噪声服从伯努利分布(在分类问题中),MLE 则导出交叉熵损失。这种「概率假设→损失函数」的映射关系,是贝叶斯机器学习和概率图模型设计的基本范式。
这种统计视角的解读,比单纯记忆最小二乘公式要深刻得多。它告诉我们,平时使用的许多损失函数,实际上都源自对数据生成过程的概率假设。理解了这一点,就能明白为什么在不同的噪声假设下,应当选择不同的损失函数。
经验风险最小化与代理损失函数
在此基础上,教程进一步引入了**经验风险最小化(Empirical Risk Minimization, ERM)和代理损失函数(Surrogate Loss Functions)**的概念。
ERM 是统计学习理论的核心框架,由 Vladimir Vapnik 系统建立。真实风险(期望风险)R(f) = E[L(f(x), y)] 衡量模型在整个数据分布上的表现,但由于真实分布未知,我们只能用训练数据上的经验风险 R̂(f) = (1/n)ΣL(f(xi), yi) 来近似。ERM 的核心挑战在于泛化:经验风险最小不等于真实风险最小,过拟合正是二者差距过大的表现。
为了量化泛化能力,统计学习理论发展出了多种复杂度度量工具。其中 **VC 维(Vapnik-Chervonenkis Dimension)**是最经典的一种,它衡量模型假设空间的表达能力,定义为模型能够完美分类("打散")的最大样本数。例如,二维线性分类器的 VC 维为 3,意味着它最多能打散 3 个点,但无法打散任意 4 个点的所有标签组合。VC 理论给出了泛化误差的上界,表明真实风险不超过经验风险加上一个与 VC 维正相关、与样本量负相关的复杂度惩罚项。这一理论从数学上解释了为什么模型过于复杂(高 VC 维)会导致过拟合,也为正则化方法提供了理论基础。Rademacher 复杂度等更现代的工具进一步细化了这些泛化界,正则化方法(如 L1/L2 惩罚)则通过限制假设空间复杂度来缩小经验风险与真实风险之间的差距。
然而在实际中,我们真正关心的损失(如分类中的 0-1 损失)往往难以优化——它是非凸、不连续的,几乎不可能直接优化。因此需要使用可微、凸的代理损失函数来替代。代理损失函数需要满足几个关键条件:首先是计算可行性(通常要求凸性和可微性);其次是 Fisher 一致性(即代理损失的最优解也是 0-1 损失的最优解)。常见的代理损失包括:logistic 损失(逻辑回归)、hinge 损失(SVM)、指数损失(AdaBoost)。Zhang(2004) 和 Bartlett 等人(2006) 的经典工作系统研究了代理损失的一致性条件,为损失函数设计提供了理论指导。这一思想贯穿了几乎所有监督学习算法的设计。
矩估计法:计算更简便的参数估计路径
除了 MLE,教程还介绍了矩估计法(Method of Moments)。这是一种计算上更为简便的参数估计方法,由 Karl Pearson 在 1894 年提出,是历史上最早的系统性参数估计方法之一。其核心思想是建立总体矩(如 E[X]、E[X²])与参数之间的方程,然后用样本矩替代总体矩求解。对于 k 个参数的模型,通常需要前 k 阶矩建立 k 个方程。
矩估计法的主要优势是计算简便,且不需要知道数据的完整分布形式。广义矩估计(GMM)是其现代扩展,由 Lars Peter Hansen 在 1982 年提出(他也因此获得了 2013 年诺贝尔经济学奖),在计量经济学中应用广泛,当矩条件数多于参数数时,通过最小化加权矩条件来获得最优估计。
值得称道的是,教程并没有回避矩估计法的局限性。相比 MLE,矩估计法虽然计算简单,但在统计效率上通常较低——即在相同样本量下,矩估计量的方差更大,且在某些情况下可能给出不合理的估计值(例如超出参数取值范围)。诚实地讨论方法的局限性,正是优质教学内容与营销式教程的分水岭。
指数加权移动平均EWMA:理解Adam等深度学习优化器的关键
本期内容的一大亮点,是对**指数加权移动平均(Exponentially-Weighted Moving Average, EWMA)**的深入讲解。这个概念看似简单,却是理解现代深度学习优化器(如 Momentum、RMSprop、Adam)的关键基础。
EWMA 的递推公式为 vt = βvt-1 + (1-β)θt,其中 β 是衰减系数(通常取 0.9 或 0.99),θt 是当前观测值。β 越大,「记忆窗口」越长,有效窗口约为 1/(1-β) 个时间步。例如 β=0.9 时,有效窗口约为 10 步;β=0.99 时约为 100 步。
教程详细解释了 EWMA 中偏差(bias)产生的原因,以及记忆(memory)如何影响平均值。在 Adam(Adaptive Moment Estimation)优化器中,一阶矩估计 mt 追踪梯度的均值方向(类似 Momentum),二阶矩估计 vt 追踪梯度平方的均值(类似 RMSprop 中的自适应学习率)。Adam 由 Kingma 和 Ba 在 2015 年提出,其参数更新公式为 θt+1 = θt - α·m̂t/(√v̂t + ε),其中 α 是学习率,ε 是防止除零的小常数(通常取 10⁻⁸)。这个更新公式的直觉是:分子中的 m̂t 提供梯度方向并平滑噪声(动量效果),分母中的 √v̂t 对每个参数维度自适应地缩放学习率——梯度变化剧烈的维度会自动降低学习率,而梯度平稳的维度则保持较大的学习率。
训练初期,由于 m0=v0=0 的初始化,前几步的移动平均会严重偏向零。偏差修正公式 m̂t = mt/(1-β₁ᵗ) 和 v̂t = vt/(1-β₂ᵗ) 正是为了消除这种初始化偏差。这个修正项在 t 较小时影响显著,随着 t 增大趋近于 1,修正效果自然消失——这正是 Adam 等优化器需要引入偏差修正(bias correction)项的根本原因。
Adam 的默认超参数 β₁=0.9、β₂=0.999、ε=10⁻⁸ 在大多数场景下表现良好,这也是它成为深度学习默认优化器的重要原因。后续变体如 AdamW(将权重衰减与 L2 正则化解耦,由 Loshchilov 和 Hutter 在 2019 年提出)和 LAMB(针对大批量训练优化)进一步扩展了其适用范围。近年来在大语言模型训练中广泛使用的优化器,如 AdaFactor 和 LION,也都可以追溯到 EWMA 这一统计学基础概念。
将统计学中的 EWMA 与深度学习优化器建立联系,是这套教程最具洞察力的地方。它让学习者意识到,那些看似孤立的深度学习技巧,背后其实有着统一的统计学根基。
白板手写推导:回归数学学习的本质
创作者特别强调,整套内容采用白板从零推导的方式呈现。在视频教程动辄依赖精美 PPT 和快速剪辑的时代,白板手写反而是一种"逆流而上"的选择。
这种方式的价值在于,它还原了真实的思考过程——每一步推导如何从上一步得来,每一个符号代表什么含义,都被清晰地展现出来。对于数学密集的内容,这种"慢节奏"恰恰有助于学习者跟上推导逻辑,而不是被结论淹没。
总结
这套约两小时的统计学教程,覆盖了从最大似然估计、线性回归、经验风险最小化,到矩估计法和指数加权移动平均的完整知识链条。它的独特之处不仅在于内容的系统性,更在于将统计学概念与深度学习实践建立起清晰的联系。
对于希望夯实机器学习数学基础的学习者,尤其是那些不满足于"知其然"、更想"知其所以然"的从业者,这类扎实的免费学习资源值得关注。理解了这些统计学基础,才能在面对新算法时具备真正的判断力。
相关推荐

李飞飞谈AI:视觉智能、创造力边界与人类主体性
斯坦福教授李飞飞在Huberman Lab播客深度解析AI与视觉科学的关系,探讨ImageNet如何引爆现代AI,阐述AI的能力边界、医疗应用前景,以及为何人类主体性是AI发展的核心命题。

DeepSeek Harness实测:插件化Agent框架的核心优势解析
深入实测DeepSeek Harness开源Agent框架,解析其插件化架构设计、编码能力、安装部署方式及与Claude Code的对比,帮助开发者了解这款可扩展Agent开发底座的真正价值。

10美元搭建50万域名搜索引擎:独立开发者的周末项目启示
一位独立开发者仅用一个周末和10美元成本,搭建了覆盖50万域名的垂直搜索引擎。本文深入分析低成本搜索引擎背后的技术栈、垂直搜索的差异化机会,以及独立开发者快速验证想法的方法论。