[控场AI]
· 7 分钟阅读· 3,521 字

从0到1搞懂AI Agent:核心原理与五大模块解析

从0到1搞懂AI Agent:核心原理与五大模块解析

本文系统拆解AI Agent的五大模块与核心循环机制,帮助初学者建立落地Agent的底层认知。

本文来自一位B站UP主的Agent入门教程,针对市面上"堆术语、走捷径"的教学痛点,主张先懂逻辑再做项目。文章以"钉钉子"为喻,阐明Agent与普通大模型的本质差异:大模型负责理解与推理,Agent则在此基础上围绕目标持续执行并根据反馈迭代。构成Agent的五大模块依次为:核心引擎(大模型)、记忆(短期上下文与长期用户历史)、规划(任务拆解与自适应调整,涵盖CoT/ToT/ReAct等方法)、工具(连接外部API与服务)、行动(真正执行操作)。这五者通过"感知—规划—行动—观察"的ReAct循环协同运转,其中"观察"环节是Agent区别于简单工作流的关键。文章最后强调,落地Agent的第一步不是选技术,而是判断业务是否真正需要Agent。

为什么调用大模型API还不够

接触过大模型的人都有一个直观感受:调用API其实是个很简单的过程——给模型输入一段内容,模型处理后返回结果。这就是我们熟悉的"输入—处理—输出"模式。但如果希望AI真正去完成一些复杂任务,仅仅让模型负责回答问题远远不够。

想象一下,让AI帮你完成一项复杂工作,它需要先理解任务,再把任务拆解成几个步骤,决定第一步做什么,执行之后观察结果,如果不符合预期还要调整计划。这个时候,AI就不再只是一个回答问题的模型,而是更接近一个能够自己处理任务的智能体——这正是Agent的本质。

这也是我们今天要去理解的agent

这位B站UP主在教程中直言不讳地指出,市面上大量Agent教程存在两个致命短板:一是本末倒置,开篇就堆砌"工具调用""任务规划""记忆机制""React框架"等专业术语,新手还没入门就被概念绕晕;二是主打"十分钟学会Agent"的速成噱头,让人只会抄代码套案例,换个场景就废。真正的入门路径应该是:先懂逻辑,再做项目。

Agent和普通大模型的本质区别

教程用了一个生动的例子来解释两者差异:假设要在墙上钉一颗钉子。如果只让你"思考"这个问题,你知道该怎么做,但光靠思考你无法拿起锤子,更无法把钉子钉进去。解决真实世界的问题,通常不是想完就得到答案,而是需要"理解问题—制定计划—使用工具—执行—观察结果",必要时还要调整计划。

这个比喻点出了关键:大模型负责核心的理解与推理,而Agent负责让模型围绕一个目标持续完成任务。普通大模型是"思考者",Agent则是能够实际"动手"并根据反馈迭代的执行系统。这也是Agent与单纯调用API最重要的区别。

构成Agent的五大模块

如果把Agent看作一个完整系统,除了作为"核心引擎"的大模型之外,它还由几个关键部分组成:记忆模块、规划模块、工具模块、行动模块。这些部分组装起来,才构成一个能够持续处理任务的Agent。

记忆:短期与长期的分工

记忆模块很好理解。假设你和AI进行了一次较长的对话:第一步提出问题,第二步补充条件,第三步根据前面结果提出新需求。如果AI完全不知道前面发生了什么,后续任务就无法继续。所以对于需要连续执行多步骤的任务,Agent必须保留必要的上下文。

记忆分为两类:短期记忆解决当前任务的上下文问题,比如运行时把当前对话过程、任务步骤和中间结果保存在运行环境里,这次运行结束后这些信息可能就消失了;长期记忆则解决另一个问题——面向用户的AI应用中,系统记录用户的交互内容,下次用户进入时通过用户ID读取历史信息。简单说,短期记忆记录"这一次任务发生了什么",长期记忆记录"这个用户过去发生过什么"。

我们做的是一个面向用户的AI

规划:任务拆解与自适应调整

规划是Agent与普通问答系统差异极大的地方。比如老板让你写一份行业分析报告,你不会拿到任务就直接动笔,而是先拆解:确定行业范围、收集资料、分析数据、整理核心结论、组织成报告。Agent也是如此,面对复杂任务时需要先判断该拆成哪些步骤,再逐步执行。

在Agent的研究实践中出现了多种规划方式,比如思维链(CoT)、思维树(ToT)以及React框架。这些方法解决的问题不完全一样,但核心目标接近:让模型不只盯着最终答案,而是围绕任务进行系统性推理与决策。

更重要的是,规划不是一次定终身。假设原本规划了五个步骤,执行到第三步时发现实际结果与预期不符,如果还按原计划执行,后续可能出现连锁错误。因此Agent必须具备根据执行结果自适应调整、重新规划的能力,这是它非常关键的特性。

思维链(Chain of Thought, CoT)是让模型在给出最终答案之前,逐步写出中间推理过程,类似人类"打草稿"的思考方式,能显著减少跳步错误。思维树(Tree of Thought, ToT)则更进一步,把单条推理链扩展成树状结构,允许模型在每一步探索多条可能路径,再从中选择最优分支,适合需要试错回溯的复杂问题。ReAct框架(Reasoning + Acting)将推理与工具调用交织在一起:模型先推理"下一步该做什么",再执行对应行动,获取真实反馈后再继续推理,形成紧密的"想—做—看"循环。这三种方式的共同价值在于:让模型不再"一步到位猜答案",而是把不确定性分摊到多个可检验的中间步骤中,从而大幅提升复杂任务的完成质量。

工具:连接真实世界的桥梁

大模型本身并不天然具备连接外部的能力。你问它"今天北京天气怎么样",如果模型没有实时联网能力,它只能根据预训练数据回答。但如果给它接入实时API——天气、股票、航班等,它就能通过这些服务获取实时信息。这就是工具的作用。

他就可以通过这些API的服务

类似的工具还有很多:计算器、代码执行、搜索工具以及各种业务系统的API。工具负责把大模型与外部世界连接起来——模型判断自己需要什么能力,就去调用对应工具;工具返回结果后,模型再据此完成后续任务。这样一个原本只能生成文本的大模型,就具备了处理外部信息和执行具体操作的能力。

工具调用在技术实现上通常依赖大模型的"函数调用"(Function Calling)能力。开发者预先声明若干工具的名称、描述和参数格式,模型在推理时若判断需要某项外部能力,就会输出一段结构化的调用指令(而非自然语言),由外部程序捕获后真正执行,再把结果返回给模型。这与普通对话的关键区别在于:模型输出的不再只是文字,而是可以被机器解析和执行的"意图"。目前主流大模型(如GPT-4、Claude、Gemini)都原生支持这一机制,部分开源框架(如LangChain、LlamaIndex)也对其进行了更高层的封装,让工具的注册和调度更加便捷。理解函数调用机制,是读懂大多数Agent代码的前提。

行动与决策循环:Agent的核心机制

有了记忆、规划和工具之后,还有一个关键部分——行动。Agent的目标不是制定计划,而是完成任务。规划出"搜索资料—整理数据—运行代码—生成结果"后,每一步都需要真正执行。

由此可以把Agent理解成一个循环系统,由感知、规划、行动、观察四步组成,这也是React执行框架的核心流程:

  • 感知:从外部环境获取输入,交给大模型理解;
  • 规划:模型根据当前任务判断问题怎么解决,下一步做什么;
  • 行动:执行具体操作,可能是生成内容,也可能是调用工具或API;
  • 观察:判断执行结果是否符合预期。

它就一定会是正确的吗

其中"观察"这一步尤其重要,它是Agent与简单工作流的本质区别。假设Agent原本计划执行五步,第一步得到的结果不一定正确。只有结果符合预期,Agent才继续下一步;若不符合,就要判断问题出在哪里、后续计划是否需要调整,从而形成新的"感知—规划—行动—观察"循环,直到任务完成。所以Agent并不是把几个API简单串起来,而是能根据环境反馈持续调整执行过程。

落地Agent的真正难点

把整体串起来看:大模型是核心引擎,记忆保存上下文与历史,规划负责任务拆解,工具连接外部能力,行动负责真正执行,再通过"感知—规划—行动—观察"不断循环。

实际开发中,不同任务适合的规划方式并不相同。简单任务如果有固定流程,用普通工作流可能更稳定;而对于动态决策、总在变化、需要根据反馈不断调整步骤的任务,才真正需要Agent。

因此,做Agent时最开始要问的不是"我该选哪种技术",而是"我当前的业务和任务到底需不需要Agent"。如果需要,再决定选择什么样的规划和决策方式。这也是后续学习任务拆解、反思、重新规划时需要重点理解的内容。

小结

Agent的核心,不是让大模型单纯回答问题,而是让它围绕一个目标具备理解任务、制定计划、调用工具、执行行动,并根据结果持续调整的能力。理解了这套底层逻辑之后,再去学习各类Agent框架、工具包和规划算法,就能更清楚它们到底如何执行、分别解决了什么问题。这正是从"会抄代码"迈向"独立落地项目"的分水岭。

分享:

相关推荐