从LLM到超级Agent:大模型应用开发核心概念全拆解

一文梳理LLM、RAG、Agent、MCP、Skills等核心AI概念的底层逻辑与演进脉络
本文以「大模型应用是如何一步步搭建起来的」为主线,从LLM的本质(预测下一个词)出发,依次拆解Prompt、Context、Memory、RAG、Function Calling、MCP、Agent、Skills、SubAgent等核心概念。文章指出,所有复杂技术都在解决同一个根本矛盾:LLM是一次性、无状态的超级员工,而现实任务是连续的、需要外部信息和多步工具调用的。Agent本质上是「提示词包装器」,其真正价值恰恰在于那些不需要智能、交给固定脚本处理的确定性部分。最终,便利性至上定理决定了Agent必然向零配置、开箱即用的方向演化,OpenClaw的爆火印证了这一判断。
刷视频、看文章,OpenClaw(小龙虾)、Skills、MCP、Agent这些词几乎无处不在,但它们到底是什么、又是怎么串起来干活的?这篇文章基于一位B站创作者的大模型应用开发讲解,把这些看似杂乱的概念一次性理顺,帮你从底层逻辑理解AI应用是如何一步步搭建起来的。
基石:LLM、Prompt、Context与Memory
要理解Agent、RAG这些听起来很厉害的东西,得先搞明白四个最底层的概念——LLM、Prompt、Context和Memory。后面所有复杂的技术,其实都是在这些基础之上搭起来的。
语言模型最初干的事特别简单,就是「文字接龙」:你给它「床前明月」,它接上「光」。但当模型参数规模和训练数据达到某个临界点后,它突然「开窍」了——能理解指令、能推理、甚至能写代码。学术界把这种现象叫做「涌现」,涌现之后的大模型就是我们说的LLM(大语言模型)。
关键在于要清醒认识它的本质:可以把LLM想象成一个能力很强的员工,但他有个核心限制——只能一问一答,做完任务就结束,不会主动追问。无论表现得多聪明,他最底层的工作方式依然是「预测下一个词」。这一点是理解后面所有问题的关键。

面对这样一个「一次性的超级员工」,怎么用才能把价值最大化?答案是把每次提问的效率提到最高。一个高效的Prompt(提示词)可以拆成两部分:Context(上下文)相当于布置任务时的背景信息,Instruction(指令)则是具体要求。比如「我们要为年轻用户群体做推广」是Context,「请写三条广告语」是Instruction,分清楚后回答质量会高很多。
而Memory(记忆)本质上并不神秘。既然LLM聊完一句就「失忆」,工程师就想了个办法:把之前的对话历史打包塞进下一次提问的Context里。这样LLM看到完整对话历史,就能「假装」记得之前的内容。更进阶的用法是让LLM把冗长历史总结成几句话再放进Memory,以节省空间。
「涌现」(Emergence)是理解当代大模型的关键现象,值得多说几句。在小规模模型上几乎观察不到的能力——比如逻辑推理、类比、代码生成——会在参数量越过某个门槛后突然涌现出来,而非随参数增长平滑提升。这一现象最早由谷歌研究团队在2022年的论文《Emergent Abilities of Large Language Models》中系统记录。为何会涌现,学界目前仍无定论,但这一特性直接催生了GPT-3、GPT-4、Claude等「有用的大模型」,也是LLM与早期统计语言模型之间的本质分水岭。理解这一点有助于解释,为什么同样是「预测下一个词」,早期聊天机器人一碰就穿帮,而现代LLM却能胜任复杂的多步推理任务。
能力扩展:让AI能查资料、能动手
LLM有个致命短板——它「不上网」。你问它今天的天气或昨天的股价,它要么瞎编,要么告诉你「知识截止到某年某月」,因为训练完就断网了。解决办法是让它去查,主流有两种方式。
第一种是Search(搜索),相当于写个小程序代替人去搜索引擎查,再把结果喂给LLM。第二种是RAG(检索增强生成),逻辑一样,只不过搜的是你自己手里的文档或数据库——比如公司内部产品手册、客服记录、合同模板,先匹配相关段落再塞进Prompt。不管哪种,核心思路都是把外部信息搬进Context,让LLM基于最新数据回答。

但Search和RAG还得靠人手动触发,太麻烦。于是有人写了个中间程序专门替LLM「跑腿」,这就是Agent(智能体)。用户不再直接跟LLM对话,而是交给Agent——它像个管家,知道什么时候该让LLM思考、什么时候该调用工具。LLM负责动脑,Tools负责动手,Agent负责传话加调度。它的本质是一个自动化协调器,减少了人类反复干预的次数。
有了工具后,新问题是「沟通容易乱套」,这里需要区分两个概念。Function Calling是大模型自身的能力,规定LLM必须按特定格式(通常是JSON)输出,相当于LLM和Agent之间的「API契约」,解决意图误解问题。而MCP(模型上下文协议)则是一个通用连接协议,可以理解成「AI界的USB接口」——它定义了tools list(告诉Agent有哪些工具可用)和tools call(调用具体工具)两个核心操作。只要工具开发商遵循MCP做一个server,任何支持MCP的应用都能直接插上用,无需重复开发。
简单说:Function Calling是LLM对Agent说的标准口令,MCP是Agent对Tools发的标准工单,两者配合才能让系统从「各自为战」变成「协同作战」。
RAG(Retrieval-Augmented Generation,检索增强生成)的技术原理稍作补充有助于理解其边界。RAG的检索步骤通常依赖「向量数据库」:文档被切成片段后,通过嵌入模型(Embedding Model)转换为高维数值向量并存储;用户提问时同样转为向量,再用余弦相似度等方法找到语义最接近的文档片段,最后连同问题一起送给LLM。这一机制意味着RAG检索到的是「语义相近」的内容,而非关键词精确匹配,对自然语言问题效果更好。其局限在于:如果原始文档质量低、切片策略不当,或问题本身需要跨多段落综合推理,检索出来的片段可能并不足以支撑准确回答,导致幻觉问题依然存在。
MCP(Model Context Protocol)由Anthropic于2024年底提出,目标是成为AI工具集成的通用标准。其核心价值在于把「工具描述」和「工具调用」从各家应用的私有实现中解耦出来:工具开发者只需实现一个符合MCP规范的Server,任何支持MCP的Client(Claude Desktop、Cursor、OpenClaw广告等)均可直接发现并调用,无需针对每个平台重新适配。这与USB-C的逻辑高度类似——在此之前,每个AI应用都在重复造「如何接工具」这个轮子。
形态进化:从Workflow到Skills再到SubAgent
当任务变复杂时,如何让AI干得稳、管得住?这一章的核心矛盾在于:无论界面多漂亮(CLI、IDE、桌面助手),面对长流程时都极其不稳定。
举个例子:让AI把一份英文PDF翻译成中文再转成Markdown保存。这涉及提取、翻译、格式化、保存几个步骤,如果全靠Agent自由发挥,它可能第一步就选错工具,还会因为每次都要重新推理整个流程而浪费大量token。这里有个关键洞察:提取PDF和保存Markdown是确定性的,写几个固定脚本就能搞定,只有翻译环节需要AI智能。所以思路应该是「该固定的固定,该智能的智能」。

为了流程固化,人们尝试了三种办法:纯代码最稳定但毫无灵活性;LangChain把Prompt、记忆、工具封装成组件,像搭乐高一样串起来,但还得懂编程;**Workflow(工作流)**用拖拽连线的低代码方式,门槛极低,但存在「排列组合爆炸」的瓶颈——输入输出格式一多,要画的工作流数量就直接爆炸。
于是有了最近很火的**Skills(技能)**概念。它是一种标准化的能力封装单元:当用户下达任务,系统先加载对应的Skill文件夹,里面必须有一个Skill.md记录核心元数据(干什么、需要什么输入、有哪些限制),还可以放可执行脚本、参考文档和静态资源。好处是不管谁开发的Skill,只要符合结构,Agent都能看懂调用,且灵活可复用。Skill本质就是把确定的流程和必要约束打包成插件,让Agent在划定圈子里发挥智能,实现灵活性和可控性的平衡。
即便有了Skills,任务特别复杂时还会遇到「上下文爆炸」——所有事情塞进主Agent的上下文窗口,模型很快记不住、注意力分散。解法是「分而治之」,引入SubAgent(子智能体)。主Agent负责统筹,把大任务拆成小任务分给独立的SubAgent。SubAgent的本质不是创造新大脑,而是做「上下文分区」,像浏览器开多个标签页互不干扰,核心目的是确保子任务的上下文不污染主任务,实现信息隔离。
LangChain是目前最广泛使用的大模型应用开发框架之一,由Harrison Chase于2022年底开源。它的核心贡献是提供了一套抽象层:把LLM调用、Prompt模板、记忆管理、工具调用、向量检索等常用操作封装成标准化组件,开发者可以用「链式调用」(Chain)的方式把它们串联。LlamaIndex则更专注于RAG场景,提供了更丰富的文档切片、索引和检索策略。两者的共同缺点是学习曲线较陡、版本迭代频繁,且过度封装有时会让调试变得困难。「上下文爆炸」问题在使用这类框架构建长流程Agent时尤为突出:每次LLM调用都会把完整的历史工具调用结果塞入上下文,token消耗快速累积,最终导致模型注意力下降或直接超出上下文窗口限制。SubAgent架构通过为每个子任务创建独立的上下文窗口,从根本上切断了这种累积效应。
终极形态:Agent的本质与便利性至上
拨开所有技术外壳,Agent的本质到底是什么?答案可能出乎意料——Agent其实就是我们和大模型之间的一个「提示词包装器」。

一方面它自动帮你加上下文、搜索网络、查知识库、读技能文档,都是为了给大模型更多背景别让它瞎猜;另一方面它把确定性逻辑外包给传统程序(PDF调OCR、Word直接解析)。所以Agent不是全能大脑,而是聪明管家——知道什么时候自己思考、什么时候喊脚本帮忙。有句点睛的话是:Agent恰恰是由「不需要智能的部分」构成的,真正有价值的地方是那些不用问大模型的地方。
从纯代码到Workflow、Skills再到纯Agent,是一条从「刚性稳定」到「柔性灵活」的光谱,没有完美方案,只有当前阶段最合适的选择。而推动Agent进化的核心驱动力是「便利性碾压一切」——只要用户觉得好用,哪怕背后代码一团乱、哪怕一天烧掉几百美元token,市场也会买单。何况token成本正快速下降。
作者提出一个「便利性至上定理」,参考Spring Boot和uv的经历:它们都不是技术上最先进的,但都是最容易用的。任何技术无论多精妙,只要让用户多点一次鼠标、多记一个命令,就会被淘汰。
这也解释了OpenClaw(小龙虾)为什么爆火。扒开底层,它和Claude Code技术上几乎没有本质区别,但它做对了三件事:一是不用打开复杂IDE,直接在社交软件里指挥;二是支持定时任务,能像秘书一样主动干活;三是可视化Skill管理,像装App一样一键添加功能。这三点第一次让普通人觉得它是「能真正帮我干活的智能体」。
由此可以大胆预测Agent的终极形态:未来会出现打包好的「超级Agent」,MCP配置、Skill脚本、SubAgent调度统统隐藏在后台,用户只需说一句「帮我安排下周出差」,剩下全交给它——零配置、开箱即用、越用越懂你。
学习路线参考
对于想系统入门的同学,视频还给出了一条分阶段路线:L0打Python基础,L1建立对大模型的整体认知并掌握提示词工程,L2掌握RAG链路构建及LangChain、LlamaIndex等工具,L3学习从单智能体到多智能体的Agent核心架构与任务编排并结合项目实战,L4进阶到模型微调与私有化部署,打造行业垂直大模型。这条路线从概念到落地,恰好对应了本文拆解的技术演进逻辑。
相关推荐

两年AI Agent工程师面试复盘:Token成本、LangGraph与生产事故
通过一场两年经验AI Agent工程师的真实面试复盘,深入解析LangGraph节点与边的成本关联、MCP协议、多Agent架构、Token成本工程,以及一次研究Agent死循环生产事故的完整排查过程。

DAWIS:用窗口化逆采样统一数据同化的滤波与平滑
DAWIS 是一种基于多任务随机插值器的统一数据同化方法,通过窗口化逆采样实现滤波、固定延迟平滑与块平滑。它能随新观测回溯修正历史状态,并在稀疏、含噪声、非线性观测下超越现有基线。

SDECast:用神经随机微分方程实现连续时间天气预报
SDECast 提出用神经随机微分方程(Neural SDE)实现连续时间概率性天气预报,解决自回归模型误差累积问题,并在逐小时全球预报中实现最长五天的技巧性预报。