零成本学完机器学习数学:可汗学院完整路线图

机器学习入门最大的门槛之一,往往不是编程,而是数学。线性代数、微积分、概率统计——这些学科听起来令人望而生畏,而市面上的付费课程价格不菲。近日,一位 Reddit 用户借助 ChatGPT 整理出一份完全基于可汗学院(Khan Academy)免费视频的机器学习数学学习路线图,引发了社区的广泛讨论。
机器学习之所以对数学有较高要求,是因为其核心算法本质上是数学优化问题的求解过程。例如,线性回归是最小二乘法的矩阵求解,逻辑回归依赖对数似然函数的梯度优化,神经网络的训练则是高维空间中链式求导与梯度下降的反复迭代。Andrew Ng 曾在斯坦福 CS229 课程中指出,真正理解算法而非仅仅调用库函数,需要扎实的线性代数和微积分功底。可汗学院由 Salman Khan 于2008年创立,目前提供超过10,000个教学视频,覆盖从小学到大学的数学课程,所有内容完全免费且配有交互式练习题,这使其成为自学者构建数学基础的理想平台。
这份路线图的核心价值不在于"列出所有数学课",而在于精准取舍——它明确告诉你哪些内容必须掌握、哪些可以选修、哪些完全可以跳过。对于自学者而言,这种"减法"往往比"加法"更有价值。

机器学习数学路线:九个阶段循序渐进
作者给出的推荐学习顺序如下:
- Get Ready for Algebra 1(仅作诊断测试)
- Algebra 1(代数一,几乎全学)
- Geometry(几何,选择性学习)
- Algebra 2(代数二,几乎全学)
- Trigonometry(三角学)
- Precalculus(微积分预备)
- Linear Algebra(线性代数,核心)
- Calculus 1(微积分一,核心)
- Multivariable Calculus(多元微积分,选择性)
- AP/College Statistics(统计与概率)
作者特别强调:你不需要学完可汗学院提供的每一门数学课。很多课程属于替代性课程或冗余内容,对构建机器学习数学基础并无必要。
代数基础:让运算变成本能
对于"Get Ready for Algebra 1",作者建议直接做课程挑战测试。如果你已经掌握基础代数,不必浪费数周时间重复学习,用它来查漏补缺即可。
而 Algebra 1 和 Algebra 2 则需要几乎完整地学习。作者点出了一个关键理念:目标是让基础代数变成自动化的能力——你应该能够不假思索地操作方程和公式,而不是每次都要停下来思考运算机制。
这一理念有其认知科学依据。认知负荷理论(Cognitive Load Theory)指出,当基础运算尚未自动化时,学习者在面对复杂问题时,大量工作记忆会被消耗在底层操作上,导致无法专注于高层概念理解。在机器学习语境中,指数函数出现在Softmax激活函数(e^x)中、对数出现在交叉熵损失函数(log loss)和信息论(信息熵 H = -Σp·log(p))中。如果每次看到这些表达式都需要回忆对数运算规则,学习效率将大打折扣。
其中,指数与对数尤其重要,它们在后续的统计、概率、优化和机器学习中反复出现。
几何与三角学:只学对ML有用的部分
这份路线图最实用的地方,是对传统数学教育中"冗余内容"的大胆裁剪。
对于几何,作者明确表示不需要学完整个课程。机器学习真正需要的是坐标几何相关内容:坐标平面、两点距离、中点、斜率、直线方程,以及平移、反射、旋转、缩放等基本变换。这些内容的目的是强化空间和坐标直觉。
这一取舍是有充分理由的。机器学习中的许多核心概念都建立在坐标几何的直觉之上:K近邻算法(KNN)直接使用欧氏距离来衡量数据点之间的相似性;支持向量机(SVM)的核心思想是在高维空间中找到一个最优超平面来分割数据,这需要理解斜率、法向量和点到平面的距离。变换操作(平移、旋转、缩放)则是数据增强、特征工程和计算机视觉中的基本操作——图像预处理中的仿射变换本质上就是矩阵乘法表示的几何变换。
而那些传统几何中占大量篇幅的内容——冗长的几何证明、全等证明、相似证明、圆定理、几何作图、详细的欧几里得几何——都被列为低优先级。这个取舍非常符合工程导向的学习逻辑:我们要的是几何直觉,而非证明技巧。
三角学同样如此。作者建议学习角度、弧度、单位圆、正弦余弦正切、三角函数图像、反三角函数和基本恒等式,但不要在复杂的三角恒等式上钻牛角尖。三角学的主要目的是为微积分和数学建模做准备。
线性代数与微积分:ML数学的核心
路线图中,作者用"CORE"(核心)来标注两门课程:线性代数和微积分一。这也与机器学习的实际需求高度吻合。
线性代数:理解 y = Xw 背后的含义
线性代数被作者称为"机器学习最核心的学科之一",建议深入学习。重点包括:
- 向量:向量运算、范数、点积、几何解释、线性组合
- 矩阵:矩阵乘法、转置、逆、行列式、方程组
- 核心概念:张成空间(Span)、线性无关、基、线性变换、正交性、投影、特征值与特征向量
在现代机器学习中,几乎所有数据都以矩阵形式存储和处理。一个包含m个样本、n个特征的数据集就是一个m×n的矩阵X。线性回归的闭式解为 w = (X^T X)^{-1} X^T y,这个表达式涉及矩阵转置、矩阵乘法和矩阵求逆。特征值分解(Eigendecomposition)是主成分分析(PCA)降维的数学基础——PCA本质上是找到数据协方差矩阵的特征向量,将数据投影到方差最大的方向上。在深度学习框架(如PyTorch、TensorFlow)中,张量(Tensor)是多维矩阵的推广,所有前向传播计算本质上都是大规模矩阵运算。GPU之所以能加速深度学习,正是因为其架构特别适合并行矩阵乘法。
作者给出了一个非常具体的学习目标:当你看到 y = Xw 这样的表达式时,应该能理解这个矩阵/向量运算实际代表什么,而不仅仅是会计算。
值得一提的是,作者还推荐了 **3Blue1Brown 的"线性代数的本质"(Essence of Linear Algebra)**系列视频,用于建立视觉直觉,而可汗学院则作为结构化学习和练习的主力资源。3Blue1Brown 是由 Grant Sanderson 创办的数学教育YouTube频道,以其独特的可视化动画风格著称。他使用自己开发的Python动画库Manim来制作数学概念的几何直觉演示。其"线性代数的本质"系列共16集,核心理念是将线性变换理解为空间的"变形"——矩阵不再是数字的方阵,而是描述空间如何被拉伸、旋转、压缩的"函数"。例如,行列式的绝对值表示变换后面积/体积的缩放倍数,特征向量是变换中方向不变的向量。这种几何直觉对于理解机器学习中的线性变换(如神经网络中的全连接层 z = Wx + b)极为有帮助。这种"直觉 + 系统训练"的组合值得借鉴。
微积分:链式法则通向反向传播
微积分一同样需要深入学习,重点是极限、连续性、导数、导数法则、链式法则、隐函数求导、导数应用、优化和积分。
作者特别指出,对机器学习而言最重要的部分是:导数、链式法则、优化,以及理解导数究竟代表什么。其中链式法则在后续学习神经网络和反向传播时会变得尤为关键——这一提示直指现代深度学习的数学基石。
反向传播算法(Backpropagation)是1986年由Rumelhart、Hinton和Williams正式引入神经网络训练的核心算法,其数学本质就是链式法则的系统化应用。在一个多层神经网络中,损失函数L关于第一层权重w₁的梯度需要通过所有中间层逐层传递:∂L/∂w₁ = (∂L/∂aₙ)·(∂aₙ/∂aₙ₋₁)·...·(∂a₂/∂a₁)·(∂a₁/∂w₁)。这正是多元复合函数的链式法则。如果不理解链式法则的本质——即复合函数的导数等于各层导数的乘积——就无法真正理解梯度消失(vanishing gradient)和梯度爆炸(exploding gradient)等训练问题的根源,也无法理解ResNet中残差连接为何能缓解这些问题。
多元微积分:梯度下降的数学基础
多元微积分是典型的"选择性学习"科目。作者按单元给出了清晰的优先级:
- 单元1(多元函数):学习多变量函数、多维图像、等高线图、向量场基础
- 单元2(多元函数求导)——高优先级:偏导数、高阶偏导数、梯度、方向导数、多元链式法则。作者强调梯度尤其重要,你应该理解
∇f的含义,而不只是会算它 - 单元3(多元导数应用):临界点、极值、鞍点、优化、Hessian 矩阵——这些直接对应机器学习中的优化问题
- 单元4(多元积分):初期低优先级,可以稍后学
- 单元5(格林定理、斯托克斯定理、散度定理):初期直接跳过
梯度下降(Gradient Descent)是机器学习中最基础的优化算法,也是多元微积分知识在ML中最直接的应用。其核心思想是:梯度向量∇f指向函数值增长最快的方向,因此沿负梯度方向更新参数可以最快地减小损失函数。参数更新规则为 θ_{t+1} = θ_t - η·∇L(θ_t),其中η是学习率。Hessian矩阵(二阶偏导数组成的矩阵)描述了损失函数曲面的曲率信息——它的特征值决定了某一点是极小值、极大值还是鞍点。在高维参数空间中,鞍点比局部极小值更为常见(这是Dauphin等人2014年的重要发现),因此理解鞍点的数学性质对于理解现代深度学习优化至关重要。Adam、RMSprop等自适应学习率优化器的设计也与二阶信息的近似密切相关。
这种按单元拆解的方式,避免了学习者在不必要的高阶内容上耗费时间。
统计与概率:从混乱目录中找到正确路径
作者坦言,可汗学院的统计学目录"特别令人困惑",存在多个看似重复的课程。他的建议非常明确:只学 AP/College Statistics(或当前对应的统计与概率课程)即可,不需要单独去学 College Probability 或 Normal Probability and Statistics,因为这些内容已被涵盖在更广泛的统计概率课程中。
在统计与概率的具体内容上,作者标出了多个高优先级模块:
- 概括统计量:均值、中位数、方差、标准差、极差。作者强调不要死记公式,而要理解这些量实际告诉了你关于数据的什么信息
- 百分位数、Z 分数与正态分布:标准化、密度曲线
- 双变量数据:散点图、协方差、相关性、线性回归——直接对应对机器学习模型和数据集的理解
- 概率:概率规则、条件概率、独立性、贝叶斯定理、加法与乘法规则
- 随机变量与概率分布:期望值、方差、离散与连续变量——对理解概率型机器学习极为重要
其中,贝叶斯定理 P(A|B) = P(B|A)·P(A)/P(B) 是概率型机器学习的理论基石。它提供了一个从先验知识(prior)出发,通过观测数据(likelihood)更新信念(posterior)的数学框架。朴素贝叶斯分类器直接应用这一定理进行文本分类和垃圾邮件过滤。更广泛地说,整个贝叶斯机器学习流派——包括贝叶斯神经网络、高斯过程、变分推断——都建立在这一框架之上。贝叶斯方法的核心优势在于能够量化预测的不确定性,这在医疗诊断、自动驾驶等安全关键场景中尤为重要。即使在频率学派占主导的深度学习领域,贝叶斯思想也通过Dropout(被证明近似于贝叶斯推断)、先验正则化等方式渗透其中。
而统计推断(置信区间、假设检验、P 值)虽然要学,但优先级较低。作者提醒:"你不需要花几个月精通每一种统计检验才能开始学机器学习。"卡方检验、ANOVA 等高级统计则可以视具体 ML 方向以后再学。
总结:一份务实的ML数学自学地图
这份路线图的最大亮点,是它体现了一种目标导向的学习哲学:不追求数学的完整性,而追求对机器学习最有用的部分。
作者还明确列出了"不需要"的课程:算术、预代数(除非确有短板)、整合数学1/2/3、大学代数、单独的概率课、微分方程、多个版本的微积分预备课、备考课程等。这些要么是替代性课程,要么是冗余内容。
对于预算有限、又想系统打好机器学习数学基础的自学者来说,这条完全免费的路径极具参考价值。当然,需要提醒的是:这份清单由 ChatGPT 辅助生成,具体学习时仍建议结合自身情况调整节奏,并搭配实际编程练习来巩固数学直觉——毕竟,机器学习的数学最终是为了"用起来",而非应试。
相关推荐

机器学习研究入门:必读论文清单与研究实习申请路径
为ML初学者整理从零到研究实习的完整路径,包括必读经典论文清单(AlexNet、ResNet、Transformer等)、论文阅读方法、复现技巧及研究实习申请的实用建议。

Claude Code 入门实战教程:安装配置到自动化开发完整指南
详解Claude Code从环境搭建、权限配置、Go目标自主循环、Skills技能系统、MCP协议集成到版本控制的完整开发流程,帮助开发者快速掌握AI编程自动化工具。

Gemini 3.7 Flash发布与GPT-5.6极速模式:AI开源迈向生态时代
谷歌发布Gemini 3.7 Flash专注编程与Agent优化,OpenAI推出GPT-5.6 Ultra-Fast模式实现14倍速度提升。AI开源从开放模型转向开放生态,Agent工具链与成本监控工具密集涌现,智能体工作流进入实用化阶段。