LangGraph入门指南:AI Agent的操作系统全解析

LangGraph是构建企业级AI Agent的底层编排框架,提供状态管理、持久化与人机协同核心能力。
本文基于一套系统性的LangGraph教程,梳理了该框架的定位、核心能力与学习路径。LangGraph被定位为「AI Agent的操作系统」,与LangChain形成高层应用与底层编排的互补关系,推荐先学LangChain再深入LangGraph。框架的三大核心要素为状态(State)、节点(Node)和边(Edge),在此基础上提供控制流编排、持久化checkpoint(支持时间旅行式回溯与故障恢复)、human-in-the-loop动态中断,以及流式执行与子图嵌套等高阶特性。这些能力共同解决了将「玩具级Demo」推向「企业级产品」所需的状态管理、容错恢复与人机协同问题,并可借助LangSmith完成云端调试与部署。
如果你想从底层代码构建一个 AI Agent,那么 LangGraph 几乎是绕不开的技术选择。随着各大公司纷纷打造自己的 Agent 产品,掌握底层编排框架的能力正变得越来越重要。这篇文章基于 B 站一套 LangGraph 系统教程整理,帮助你厘清 LangGraph 的定位、核心能力与学习路径。
为什么要学习 LangGraph
我们已经全面进入 AI Agent 的时代,基本上每家公司都在构建独一无二的 Agent 产品。LangGraph 之所以被称为「Agent 的操作系统」,在于它提供了可靠的持久化执行引擎和完善的人机协同能力,在 AI Agent 的生产落地中占据着不可或缺的地位。
与仅仅调用大模型 API 的简单封装不同,LangGraph 关注的是复杂 Agent 工作流的编排:状态如何流转、节点如何衔接、执行如何持久化与恢复。这些正是把一个「玩具级 Demo」推向「企业级产品」的关键能力。

LangGraph 与 LangChain 的关系
学习 LangGraph 时不可避免要与 LangChain 做对比。需要明确的是,二者并不是对立关系,而是协同工作的关系。官方对两个框架的定位本身就有明确分工:
- LangChain 更倾向于顶层的应用层设计,让用户以最简单、最直观、最快速的方式上手构建 Agent。大多数 AI Agent 项目都从 LangChain 最基础的
create agent开始,直接对接一个大模型即可开始工作。 - LangGraph 更倾向于底层源码的架构编排。当你需要复杂的编排逻辑——比如持久化检查点、human-in-the-loop 架构——这时候就该引入 LangGraph。
因此比较推荐的学习顺序是:先掌握 LangChain 的应用层用法,再深入 LangGraph 的底层编排。
从技术演进角度看,LangChain 诞生于 2022 年底,最初以「链式调用」(Chain)为核心抽象,将提示词模板、模型调用、输出解析等步骤串联成可复用的管道。随着 Agent 场景复杂度提升,链式结构的线性局限逐渐暴露——它难以表达循环、条件分支和并发等非线性控制流。LangGraph 于 2024 年初作为独立子项目发布,以有向图(DAG 或带环图)为核心抽象,天然支持循环执行和复杂分支,从根本上解决了这一问题。两者共享同一个生态(模型接入层、工具调用规范、LangSmith 可观测平台),因此学习路径上的衔接成本较低,已有 LangChain 基础的开发者可以较平滑地过渡到 LangGraph。
课程六大模块概览
这套教程将内容划分为六大模块,覆盖从基础入门到企业级部署的完整链路。其中一个较为特殊的模块是「环境工具链」,它需要独立完成开发环境的部署,因此单列出来。
其余模块按学习深度递进:
- 基础入门:认识状态、节点、边这三大组件,从最基础的代码开始上手。
- 控制流:实现不同逻辑控制下的 LangGraph 流程。
- 核心功能:持久化 checkpoint、中断(human-in-the-loop)以及上线部署。
- 部署:借助 LangSmith 实现完整的 UI 界面与云端部署。
- 高级特性:流式执行、子图(在图中嵌套子图)等进阶用法。
课程声称覆盖了官方介绍的 LangGraph 所有功能,学完即可从底层完整掌握该框架。

核心能力拆解
三大要素:状态、节点、边
这是学习 LangGraph 最基础的入门能力。定义一个图时,最核心的三个要素就是状态(State)、节点(Node)和边(Edge)。这部分是整个课程的地基,讲解节奏也会相对放慢,目的是让学习者彻底掌握。

控制流
打个比方,学 LangGraph 的控制流就像学 Python 语言一样——了解完最基础的语法结构后,接下来就是让逻辑代码按照你想要的方式运行。控制流决定了图中的执行路径如何根据条件分支、循环。
持久化与可恢复执行
第三项核心能力是持久化与可恢复执行。通过 checkpoint 做状态落盘,可以实现所谓的「时间旅行」——检查点回溯功能。这意味着 Agent 在执行过程中出现故障,也能从某个检查点恢复,这是企业级应用中至关重要的容错能力。
Checkpoint(检查点)机制的核心思想来自分布式系统中的快照容错:在计算过程的若干关键时间点将完整状态序列化并存储到持久层(SQLite、PostgreSQL 或自定义后端均可),一旦执行失败或需要回溯,可以从任意历史快照重新恢复执行,而无需从头重跑。LangGraph 的「时间旅行」(Time Travel)功能即构建在此之上——开发者可以在 LangSmith 界面中选取某个历史检查点,修改状态后重新执行后续节点,极大地方便了调试与行为复现。这一能力在长时任务(如多轮自主研究、代码生成迭代)中尤为关键,因为一次失败意味着可能损失数分钟乃至数十分钟的推理成本。
Human-in-the-loop
第四项能力是 human-in-the-loop,即把人为的步骤抉择添加到整个 AI Agent 的执行过程中。教程用了一个形象的说法:有了 AI 之后,打工人某种程度上变成了 AI 的「领导」,大多数工作交给 AI 执行,而人则像老板盖章那样做审核决策。
要实现这种在关键节点让人介入的能力,就需要用到 LangGraph 的动态中断(dynamic interrupt)机制。

动态中断(Dynamic Interrupt)是 LangGraph 实现 Human-in-the-loop 的底层机制:在图的任意节点执行前后,开发者可以插入 interrupt() 调用,使整个图的执行在该点挂起并将当前状态持久化。外部系统(前端界面、审批流、消息队列等)收到挂起信号后可向人类呈现上下文并等待输入,人类决策结果写回状态后图从断点处继续执行。这与传统 RPA 或流程自动化中的「人工审批节点」概念相似,但 LangGraph 的实现是无阻塞异步的——挂起期间不占用服务器线程,支持跨进程甚至跨机器的状态恢复。典型应用场景包括:AI 生成合同草稿后等待法务审核、自动化交易系统在超过阈值时请求人工确认等。
高阶特性:流式执行与子图
第五项是高阶特性,包括流式执行(streaming)和子图。流式执行关注如何在过程中实时产出对应的输出内容;子图则允许在一个图中再嵌套一个子图,从而构建更加模块化、可复用的复杂工作流。
流式执行(Streaming)在 LangGraph 中有多个粒度层级:Token 级流式(逐 token 输出 LLM 响应)、节点级流式(每个节点执行完成时推送状态更新)以及事件流(所有中间事件的完整日志)。子图(Subgraph)则对应软件工程中的「模块化」思想——将可复用的子工作流封装为独立的图,以节点的形式嵌入父图中调用,父子图各自维护独立的状态空间,通过定义好的接口传递数据。这使得大型 Multi-Agent 系统可以按职责拆分为多个独立开发、独立测试的子图,再组合成复杂的整体编排,显著提升代码的可维护性与团队协作效率。
学完能达到什么水平
按照课程设定,学完这套内容你将具备以下能力:
- 从零开始编写 LangGraph 代码,构建 AI Agent 工作流;
- 掌握企业级的持久化、故障恢复与人机协同核心能力;
- 借助 LangSmith 完成产品的云端调试与云端部署;
- 深入理解 LangChain / LangGraph 的生态体系,学会对接各种大模型。
小结
LangGraph 的价值在于把 AI Agent 从「能跑」推向「可靠可用」。它补齐了简单 API 调用所欠缺的状态管理、容错恢复与人机协同能力,是构建复杂 Agent 系统的底层基础。对于希望深入 Agent 开发的人来说,先打好 LangChain 应用层基础、再攻克 LangGraph 底层编排,是一条较为务实的进阶路径。
相关推荐

tiun.:为AI开发者打造的一站式认证与支付系统
登顶 Product Hunt 的 tiun. 为 AI 开发者提供认证、支付、账单、客户数据与分析的一体化系统,一条命令即可安装,帮助开发者当天上线付费产品。本文解析其定位、卖点与竞争格局。

Voiskey:能读懂语境的AI语音输入工具
Voiskey是一款登上Product Hunt排名第3的AI语音输入工具,能根据场景和读者自动调整语气,比打字快5倍,支持iOS、macOS、Android、Windows四大平台及100多种语言。

Axari:让AI分身接管你的安全运营琐事
Product Hunt新品Axari主打「AI分身」概念,帮安全团队自动处理重复性运营琐事,可在Slack、MS Teams中指派目标并自主推进任务。本文解析其产品逻辑、行业定位与需要冷静看待的问题。