《机器学习实战》读完之后,AI工程师进阶路径全解析

从传统ML教材毕业后,如何分三层递进地转型为能落地LLM应用的AI工程师。
文章针对「读完《Hands-On Machine Learning》后不知下一步该做什么」这一典型困境,系统梳理了从ML工程师向AI工程师转型的学习路径。核心观点是:传统ML教材建立了扎实基础,但对以LLM为中心的现代AI技术栈(RAG、Agent、Prompt工程等)覆盖有限,需要主动补齐。文章给出三层递进策略:先通过Karpathy等人的资源建立对Transformer的底层认知,再动手做RAG系统、AI Agent等真实项目,同时保持独立编码的习惯以锻炼真实解决问题的能力。推荐了Hugging Face课程、Chip Huyen等人的书籍以及DeepLearning.AI短课作为配套资源,并强调「以项目驱动、缺什么补什么」比按部就班读完教材更为高效。
读完经典教材后的常见学习困境
在机器学习的自学路径上,几乎每个人都会遇到同一个转折点:读完了一本经典教材,比如 Aurélien Géron 的《Hands-On Machine Learning》(机器学习实战),却发现自己站在一个岔路口——传统机器学习的知识框架已经搭起来了,但面对 RAG、LLM、生成式 AI 这些「更高概念层」的技术栈,却不知道从何下手。
最近 Reddit 上一位学习者就抛出了这样的问题:他已经完成了这本被誉为 ML 入门圣经的教材,目前正在 Kaggle 上做竞赛练手(并非为了冲榜,而是想适应脱离教程独立编码的状态),同时希望通过做项目来学习新概念。他的核心疑问是:下一步该学什么?
这个问题背后,其实反映了当下 AI 学习者普遍面临的知识结构升级需求——从「机器学习工程师」向「AI 工程师」的角色转变。

传统ML与现代AI工程的知识鸿沟
《Hands-On Machine Learning》这本书的价值肯定的是,它系统覆盖了监督学习、无监督学习、神经网络基础以及 TensorFlow/Keras 的实战应用。但需要清醒认识到:这本书的知识体系主要建立在深度学习大爆发前后的技术范式上,对于由大语言模型驱动的生成式 AI 浪潮,覆盖是有限的。
机器学习工程师与AI工程师:两条技术路线的分野
如今「AI 从业者」大致分化为两个方向:
- 机器学习工程师(ML Engineer):偏重模型训练、特征工程、数据管道、模型部署与优化。Kaggle 竞赛正是这条路线的绝佳训练场。
- AI 工程师(AI Engineer):更侧重于基于现有大模型(如 GPT、Claude、Llama)构建应用,涉及 Prompt 工程、RAG(检索增强生成)、Agent 编排、向量数据库、LLM 应用架构等。
提问者显然希望向后者靠拢。这是一个明智的选择——因为当前产业界对「能把 LLM 用起来解决实际问题」的工程师需求量极大,而这部分技能恰恰是传统 ML 教材的盲区。
RAG(Retrieval-Augmented Generation,检索增强生成)是当前AI工程中最核心的应用范式之一。其基本原理是:在向大语言模型提问时,先从外部知识库中检索与问题最相关的文档片段,将其作为上下文一并输入模型,从而让模型的回答基于最新的、私有的或领域专属的信息,而非仅依赖训练时固化的知识。这解决了LLM的两大痛点——知识截止日期和幻觉问题。向量数据库(如Chroma、FAISS、Pinecone)是RAG系统的关键基础设施:它将文本转化为高维数值向量(embedding),通过语义相似度而非关键词匹配来检索内容,使得「理解含义」的搜索成为可能。Agent则更进一步,指让LLM具备自主规划和调用外部工具(搜索引擎、代码执行器、API等)的能力,将模型从「问答机器」升级为「能采取行动的智能体」。
AI工程师学习路径:分层递进指南
第一层:巩固 LLM 底层认知
在扎进 RAG 和应用开发之前,建议先补齐对 Transformer 架构的理解。这里有几个免费且高质量的资源:
- Andrej Karpathy 的 YouTube 系列:他的「Let's build GPT」和「Neural Networks: Zero to Hero」系列,从零手写实现,是理解 LLM 内部机制的最佳材料之一。
- 3Blue1Brown 的神经网络与 Transformer 可视化视频:用直观的动画解释注意力机制,适合建立几何直觉。
这一层不是要你能从头训练一个 GPT,而是让你在使用大模型时,不至于把它当成一个纯粹的黑盒。
Transformer架构是理解现代LLM的核心前提,由Google于2017年在论文《Attention Is All You Need》中提出。其最关键的创新是自注意力机制(Self-Attention):它允许模型在处理序列中每个词时,同时「关注」序列中其他所有位置的词,并动态计算它们的相关权重。相比此前主流的RNN/LSTM结构,Transformer不仅解决了长距离依赖问题,还天然支持并行计算,使得在超大规模数据集上训练成为可能。GPT系列、BERT、LLaMA等几乎所有现代大模型都建立在Transformer的变体之上。理解注意力机制的运作方式,能帮助你更好地设计Prompt、理解模型在不同输入下的行为差异,以及在微调时做出更合理的决策。
第二层:动手做 LLM 应用项目
概念清晰后,最有效的学习方式还是做项目。可以从这些方向入手:
- RAG 系统搭建:构建一个「和你的文档对话」的应用。技术栈可以选择 LangChain 或 LlamaIndex,配合向量数据库(如 Chroma、FAISS)。这是理解检索增强生成最直接的实战项目。
- AI Agent 开发:尝试用工具调用(Function Calling)让模型能够执行搜索、计算、访问 API 等操作。
- 模型微调实践:在了解基础后,可以借助 Hugging Face 的生态尝试对小模型进行 LoRA 微调。
Hugging Face 官方的免费课程(NLP Course、LLM Course)质量很高,且紧跟最新技术,非常适合作为这一阶段的主线教材。
LoRA(Low-Rank Adaptation)是目前最主流的大模型参数高效微调方法。全量微调一个数十亿参数的LLM需要极高的显存和算力成本,而LoRA的思路是:冻结原始模型的全部权重,只在特定层旁边插入一对低秩矩阵(参数量极小),训练时只更新这两个小矩阵。推理时将其合并回原始权重,不增加额外延迟。这使得在消费级GPU上对LLM进行特定任务的定制化训练成为可能。Hugging Face的PEFT库封装了LoRA及其变体(如QLoRA,支持4-bit量化以进一步压缩显存占用),大幅降低了微调的工程门槛。对于希望将LLM适配到垂直领域(如法律、医疗、代码生成)的工程师,LoRA微调是性价比最高的技术路线。
第三层:坚持独立编码的习惯
提问者提到自己在 Kaggle 上刻意减少对教程和 AI 助手的依赖,这个习惯值得高度肯定。在 AI 编程工具泛滥的时代,独立解决问题的能力反而变得更加稀缺和珍贵。
合理的做法是:先自己尝试实现,卡住后再借助 AI 提示,最后一定要回过头理解 AI 给出的方案为什么有效。把 AI 当成随时可问的导师,而不是替你写代码的枪手。
高质量书籍与课程推荐清单
除了上述资源,还有几本值得关注的进阶材料:
- 《Designing Machine Learning Systems》(Chip Huyen 著):偏向 ML 系统设计与生产化部署,弥补教材在工程落地上的不足。
- 《Build a Large Language Model (From Scratch)》(Sebastian Raschka 著):手把手带你实现一个 LLM,深度补齐底层认知。
- DeepLearning.AI 的短课程系列:吴恩达团队与各大公司合作推出的免费短课,涵盖 RAG、Agent、LangChain、Prompt 工程等主题,短小精悍,非常适合快速上手。
给机器学习自学者的实用建议
最后需要强调的是,AI 领域知识更新极快,不必陷入「学完一本书才能开始下一步」的完美主义焦虑。更高效的策略是以项目为驱动,缺什么补什么。
当你在做一个 RAG 应用时遇到检索效果不佳,自然会去研究 embedding 模型和文档分块策略;当你的 Agent 频繁出错,你会主动去学 Prompt 优化与评估方法。这种由真实问题倒逼的学习,比按部就班读完一本教材要牢固得多。
从《Hands-On Machine Learning》毕业,只是一段旅程的开始。传统 ML 的功底会成为你理解现代 AI 的坚实基础,而接下来要做的,就是把手弄脏,在真实项目中把 LLM 用起来。
相关推荐

@ai-sdk/zai@3.0.10 发布:依赖更新的补丁版本解析
Vercel AI SDK 发布 @ai-sdk/zai@3.0.10 补丁版本,同步更新 provider、provider-utils 与 openai-compatible 等底层依赖。本文解析该版本变更内容及 AI SDK provider 体系的设计意义。

Vercel AI SDK 更新:@ai-sdk/workflow 2.0.29 修复工具结果保留问题
Vercel AI SDK 发布 @ai-sdk/workflow 2.0.29 补丁版本,核心修复工作流在终止、延迟、暂停三种响应状态下 provider 工具执行结果的保留问题,并同步升级 ai@7.0.98 等核心依赖。

Vercel AI SDK 更新:@ai-sdk/xai 4.0.58 批处理与图像生成改进
Vercel AI SDK 发布 @ai-sdk/xai 4.0.58 版本更新,新增批处理图像生成支持,修复批处理请求类型校验及 DeepSeek 推理流问题,并同步升级 provider 相关依赖。