AI Agent 面试核心考点:本质、四大组件与规划模式详解

AI Agent 是以LLM为决策核心、整合工具、记忆与规划能力的自主执行系统,而非单纯的语言模型。
本文系统拆解了AI Agent的本质与四大核心组件,主要面向技术面试场景。文章首先澄清了"Agent等于LLM"的常见误区,指出Agent的本质是"决策→行动→观察→再决策"的持续循环,而非一次性问答。随后逐一介绍四个组件:LLM作为统一决策中枢;工具是Agent与外部世界交互的唯一接口;记忆系统分为短期(上下文管理)和长期(向量检索)两类,核心矛盾是信息保留与窗口限制的平衡;规划能力则通过CoT、ToT等方法以及ReAct、Plan and Execute两种生产模式实现复杂任务分解。文章最后用"自主性、行动性、多步迭代"三个特性提炼出面试标准答案。
什么是 AI Agent:被面试官反复追问的本质问题
在 AI 相关岗位的面试中,"你是怎么理解 Agent 的"几乎是必问题。很多候选人把 Agent 直接等同于大语言模型(LLM),这是一个典型误区。Agent 并不是模型本身,而是以 LLM 为控制核心、围绕目标自主推进的 AI 执行系统。
理解这句话有两个关键点:第一,它依托于大语言模型做决策;第二,它具备自主推进能力——能够自主分析复杂任务、安排执行路径,并最终返回令用户满意的结果。
Agent 与传统问答式 AI 的根本差异,不在于"回答得更好",而在于工作方式发生了改变。传统问答系统是被动响应:你问一个问题,它给一个答案,一来一回,每次输入输出相对独立。而 Agent 是在目标驱动下持续进行任务拆解、工具调用和状态维护,通过多轮迭代逐步逼近结果。
因此,Agent 的本质不是一次推理,而是一个决策 → 行动 → 观察 → 再决策的运行循环。记住这个循环,面试时就抓住了核心。
组件一:大语言模型是 Agent 的大脑
Agent 的核心组件可以归纳为四部分:大语言模型、工具、记忆系统、规划能力。四者缺一不可。
其中 LLM 是整个系统的决策中枢。用户指令、工具返回结果、记忆检索结果、当前任务状态,最终都会汇聚到大语言模型,由它判断下一步动作——是继续推理、调用某个工具、请求用户补充信息(即人工介入的 human-in-the-loop),还是直接输出答案。没有 LLM 做统一决策,其余组件只是孤立的能力模块。

在实际使用中,模型选型需要重点关注几个维度:
- System Prompt(系统提示词):定义 Agent 的角色、行为边界、输出格式和约束条件,相当于整个 Agent 的说明书。
- 模型推理能力:不同模型差距很大。相同提示词下,推理能力强的模型在任务分解、工具选择和错误恢复上表现更好。不过对日常开发工作而言,无论 GPT、DeepSeek广告 还是智谱 GLM,通用大模型的能力已经足以覆盖需求,没必要盲目追求高性能模型——性能越高,token 成本也越高。
- 工具调用稳定性:核心是结构化输出能力。格式错误或参数乱填会导致调用失败、重试和 token 浪费。
- 上下文窗口:Agent 每一步的工具结果和中间状态都会进入上下文,复杂任务执行多步后窗口很容易被占满。
模型选择不是越贵越好,而是要在推理能力、延迟、成本和上下文容量之间做权衡。
组件二:工具是 Agent 与外部世界的接口
工具是四个组件中最容易理解的一个。LLM 本身只是语言处理器,不能直接上网、读文件、执行代码或操作业务系统。它可以生成一封邮件的内容,但无法真正把邮件发出去。
工具正是 Agent 采取行动、感知外部反馈的唯一入口。任何能用函数封装的能力都可以成为工具——如果用过 LangChain 这类框架,就会发现定义工具和定义一个普通函数几乎一样,只需在函数上加一个注解即可。

搜索引擎、数据库查询、代码执行器、发送邮件……这些都可以封装为工具。更进一步,现在流行的 Skills、外部 MCP 服务、Claude Code 里的 Hooks(钩子),本质上都是工具的不同形态。它们的共同点在于:为 Agent 提供与外部世界交互的接口。Agent 正是通过工具突破了模型自身的能力边界,并通过工具返回结果来了解行动的实际效果。
MCP(Model Context Protocol)是 Anthropic 于 2024 年底推出的开放协议,旨在标准化 AI 模型与外部工具、数据源之间的连接方式。在 MCP 出现之前,每个 Agent 框架都有各自定义工具的规范,工具难以跨框架复用。MCP 提供了统一的服务器-客户端架构:工具提供方以"MCP Server"形式发布能力,任何兼容 MCP 的 Agent 应用都可以直接调用,类似于为 AI 工具生态建立了"USB 标准接口"。目前 Claude、Cursor 等主流产品已原生支持 MCP,市面上也出现了大量开源 MCP Server,覆盖文件系统、浏览器控制、数据库操作等常见场景,极大降低了 Agent 接入外部能力的开发成本。
组件三:记忆系统维持状态与跨任务连续性
记忆解决的是 Agent 执行过程中"失忆"的问题,通常分为短期记忆和长期记忆。
短期记忆
短期记忆指当前任务或对话的上下文,保存中间状态、工具结果和决策依据。比如让 Agent 帮你开发一个系统,过程中需要多轮对话,这些对话信息必须被保留,否则下一轮提问时 Agent 就无法基于上一步结果继续推进。
短期记忆的核心矛盾是:复杂任务会产生大量中间信息,但上下文窗口有限,必须在"记住足够多"和"不撑爆"之间做平衡。常见处理方式包括压缩、摘要、滑动窗口和外部卸载。

举例来说:压缩是把整体内容缩小;摘要是把 100 个字浓缩成 10 个字只保留要点;滑动窗口是只保留最近 N 轮对话;外部卸载则是把部分信息移出记忆。但无论哪种方式,最终都会导致一定程度的记忆丢失,进而影响下一步执行结果。用过 Claude Code 或 Codex 的人应该都遇到过上下文撑满、需要做摘要压缩的场景,这背后的策略和技巧非常关键。
长期记忆
长期记忆用于跨会话、跨任务保留信息,常见实现方式是向量数据库 + Embedding 向量化 + 语义检索。完整的长期记忆系统往往还需要结构化存储、图数据库、元数据过滤、写入策略和冲突更新等机制。
长期记忆的设计难点在于:什么信息值得持久化,什么该丢弃。存太多会引入噪声导致检索不准,存太少又失去了长期记忆的意义。更合理的做法是在写入前做重要性评估,只保留真正影响后续决策的信息。
向量数据库与 Embedding 是长期记忆的技术基础,值得单独说明。Embedding(嵌入)是将文本转换为高维数值向量的过程,语义相近的文本在向量空间中距离更近。向量数据库(如 Pinecone、Weaviate、Chroma)专门用于存储和检索这类向量,支持"语义检索"——即根据含义而非关键词匹配来找到相关记忆片段。举个例子,Agent 之前处理过"用户偏好深色主题",下次执行 UI 相关任务时,系统通过语义检索就能自动召回这条记忆,即使用户没有再次提及。这与传统数据库按精确字段查询的方式截然不同,是 Agent 实现"跨会话记忆"的核心机制。
组件四:规划能力决定 Agent 能否处理复杂任务
规划是把复杂目标拆解成可执行步骤的能力,底层依赖 LLM 的推理能力。
常见的规划方法有:
- CoT(思维链):让模型显式写出推理步骤。由于 LLM 逐步生成、逐步消耗 token,中间推理会成为后续生成的条件,从而减少跳步或逻辑断裂。相当于把一个复杂任务拆成十个步骤,逐一执行,不遗漏中间环节。
- ToT(思维树):在推理节点上展开多个候选分支,评估各分支质量后选择最优路径继续推进,适合高不确定性、需要多路径探索的任务。
- 思维图使用较少,了解即可。

在实际生产环境中,规划模块主要有两种模式:
ReAct 模式:每一步都根据当前观察重新决定下一步,不提前制定完整计划,走一步看一步。优点是灵活,缺点是容易陷入局部最优而忽略最终目标。
Plan and Execute 模式:先由 LLM 生成完整的步骤列表,再按计划执行。优点是结构清晰、便于审查,缺点是当中间结果偏离预期时,原计划可能失效。
实际工程中,两者往往结合使用:先做粗略计划确定大方向,再在执行过程中根据反馈动态调整。
ReAct 模式的名称来自"Reasoning + Acting"的组合,由普林斯顿大学 2022 年提出的同名论文推广。其核心思路是将推理(Thought)、行动(Action)和观察(Observation)交替写入上下文,让模型在每一步都能看到自己的推理过程和上一步工具返回的结果,从而做出更有依据的下一步决策。这种"边想边做、边做边想"的模式与人类处理陌生任务时的方式类似,是目前开源 Agent 框架(如 LangChain、LlamaIndex)中最常见的默认规划策略。其局限性在于,缺乏全局视角,当任务需要协调多个相互依赖的子目标时,容易出现"只顾眼前"的短视行为。
面试总结:如何用一句话讲清 Agent
Agent 的本质是以 LLM 为决策核心,结合工具、记忆和规划能力,能够自主拆解并完成复杂目标的执行系统。理解它的关键在于三个特性:
- 自主性:大语言模型自主进行推理和任务规划;
- 行动性:通过工具与外部世界交互、完成具体任务;
- 多步迭代:不是一次推理就返回结果,而是多轮循环逼近目标。
同时还要注意几个约束条件——上下文窗口、工具稳定性、token 成本和延迟。
一句话收尾:Agent 不是一个更聪明的模型,而是一套围绕目标持续运行的决策与执行系统。 面试时把这几个要点讲清楚,基本就能让面试官满意。
相关推荐

Rysh Forge 实测:一份 OpenAPI 规范自动生成 Claude 可调用的 Agent 工具
Rysh Forge 用一条命令把 OpenAPI 规范自动转换成 Claude 可调用的 Agent 工具,同时生成 MCP server、Python SDK 和文档,并对写操作强制人工确认,实现全链路可观测。本文解析其工作流与价值。

OpenAI Agents SDK 实战:如何实现 Human-in-the-Loop 人工审批
基于 OpenAI Agents SDK 实现 Human-in-the-Loop 人工审批机制的完整教程:从 needs_approval 暂停工具调用、捕获 interruptions 中断,到 approve/reject 决策与 RunState 状态序列化恢复,让 AI Agent 在执行高风险操作前先征得人类同意。

MaRN开源:用低维参数映射训练神经网络的PyTorch库
开源PyTorch库MaRN通过低维参数映射训练神经网络,MNIST CNN参数压缩57.7倍仍保持91.8%准确率。本文解析其基准测试、功能构成与适用场景。