智能体自我改进综述:现代Agent如何实现自进化

综述系统梳理了智能体自进化的历史、形式化框架与基础模型/脚手架两条技术路径,并指出验证有效性是当前最大瓶颈。
吉林大学顾丹丹教授解读了一篇关于"现代智能体系统自我改进"的综述,系统梳理了自进化从哥德尔、冯·诺伊曼到大模型时代的百年演进。自进化的核心定义是"由系统自身诱导信号驱动、对内在配置进行实质性修改",区别于被动接受外部数据的传统学习。综述将现代Agent拆为基础模型与脚手架两部分,基础模型进化通过示范生成、自生成反馈和行动学习三类信号更新参数,能持久内化经验但成本高;脚手架进化则在不改变参数的前提下修改Prompt、记忆、工具乃至整体工作流,灵活低成本且可回滚。当前最大瓶颈是如何验证改进是否有效,在开放式任务中尤为突出,回滚机制与可靠内部评估是亟待攻克的研究缺口。
当应用场景日益复杂,如何让智能体在减少人类干预的情况下持续提升能力、自我纠错并吸收经验,成为Agent落地的关键挑战。吉林大学人工智能学院顾丹丹教授在NSAE知识分享中,解读了她与阿卜杜拉国王大学AI先驱团队联合发布的综述《现代智能体系统的自我改进》,系统梳理了这一领域的历史脉络、形式化定义与技术路径。
什么是自进化:从最小二乘法到自我诱导
要理解自进化,可以从经典的最小二乘法讲起。作为一种参数估计方法,最小二乘法通过最小化误差函数来学习模型参数,尽管复杂化模型可以拟合复杂数据,但它的底层函数结构与优化算法都是由人类事先定义好的。它只能被动接受外部数据和人为设计的损失函数,无法在学习机制不适配时审查或重写自身。
这正是自进化要突破的边界。综述给出的定义是:自我改进是一种由系统自身诱发的更新过程——系统在执行当前策略、与任务交互时会产生学习信号,这些信号被利用后可对系统内在配置进行实质性修改,从而改变支配其未来行为的策略。核心在于"自我诱导"这四个字。

这个概念并非新事物。顾教授回顾了其百年演进:1931年哥德尔证明形式数学系统能对自身命题及可证明性进行编码;后续有学者提出"超智能机器"设想,认为一旦机器能设计出比自身更强的机器就会触发智能爆炸;冯·诺伊曼从自动机理论出发研究系统如何描述自身结构完成自我复制;2003年提出的"哥德尔机"则确立了只要能证明某项修改会提升未来效用,系统就可重写自身代码(包括改进机制本身)的理论框架。
哥德尔机(Gödel Machine)是理解自进化理论基础的关键概念。2003年由Jürgen Schmidhuber提出,它是一种完全自指的通用问题求解器理论框架:系统将自身的完整代码(包括搜索算法和学习机制)视为可修改对象,只要系统能通过形式化证明确认某项自我修改会提升其未来预期效用,便可执行该修改——包括修改用于证明改进的机制本身。这一框架的哲学意义在于它打通了"元层"与"对象层"的壁垒,自我改进不再限于权重调整,而是可以延伸到系统对自身推理逻辑的重写。其局限在于构造形式化证明的计算代价极高,长期以来停留在理论层面,而大语言模型提供的自然语言推理能力为近似实现这一框架带来了新的可能。
为什么现在重要:大模型让自进化焕发生机
概念虽早,为何到大模型时代才真正升温?关键在于前大模型时代的两大瓶颈。其一是缺乏对世界知识的广泛理解和强推理能力,模型本身难以给出有效的自改进策略;其二是可修改的载体受限,传统自改进方案需要在原始神经网络权重或汇编程序表示这类庞大的底层空间中搜索,代价极高,难以应对开放式任务。
大模型改变了这一局面。经过海量预训练数据训练、架构与参数规模反复调优的大模型具备强大的通用知识理解和推理能力,能够胜任"给出改进策略"的角色。更重要的是,大模型以自然语言作为连接人与模型的语义接口——自然语言天然便于显式表达和解释改进内容,你做了什么修改通过语言一目了然。当自然语言成为共享的语义接口,自进化就更容易实现。
现代Agent系统的形式化拆解
综述将现代Agent系统定义为两部分构成:一是基础模型(Foundation Model)的参数θ,二是脚手架(Scaffolding,也即业界常说的Harness)。脚手架又细分为提示词(Prompt)、记忆(Memory)、工具(Tool)以及整体流程的控制逻辑。用户将需求作为输入交给Agent后,脚手架负责感知与理解,基础模型作为"大脑"进行推理,再与环境交互获取反馈,最终产出结果。

自进化则被形式化为从时刻t到t+1的迭代:系统利用自我诱导产生的信号S,通过改进函数得到进化后的Agent。综述据此分成两条主线——基础模型的进化(第五章)与脚手架的进化(第六章),每一章又根据"学习信号从何而来"进行子分类。
基础模型进化:把经验内化进参数
通过修改基础模型参数实现进化,综述按学习信号来源分为三类。
第一类是内在生成的示范数据(Demonstration)。模型自身生成面向当前任务的训练数据,再通过参数更新把临时经验沉淀内化。代表工作让模型在每轮循环中生成候选的"自我编辑"来更新权重,再据奖励提升能力。这类方法的风险是误差累积——一旦自生成数据不准确,反复迭代可能导致模型坍塌,综述也讨论了相应的缓解方法。
第二类是自生成反馈(Feedback)。让Agent充当批评者产生评估信号,判断标准可以是明确准则、多次采样的一致性投票,或直接批判并给出修改意见。代表性的Test-Time Reinforcement Learning正是通过多次生成答案并多数投票,把投票结果当作伪标签计算奖励,从而在缺乏真实标签时更新模型。
第三类是通过行动学习,即Agent与外界交互获取反馈作为经验。真实环境(如代码、网络、GUI)交互代价高昂,因此另一条路径是从想象的代理环境学习,比如训练世界模型替代真实环境。2026年的一项机器人相关工作就用世界模型生成可学习的模拟经验,让机器人在此基础上自我改进,大幅降低对真实世界交互的依赖。

基础模型进化的特点是能把经验持久内化为权重,实现广泛而持久的能力提升;代价是成本高,且对自诱导信号的质量要求较高。
脚手架进化:低成本的灵活适应
脚手架进化不改变模型参数,而是修改Prompt、Memory、Tool乃至整个工作流,综述据此分为四部分。
提示词进化按反馈信号分为四种:标量反馈(根据精度、偏好分数反过来优化Prompt)、质量反馈(用批评、误差分析等自然语言内容优化)、基于种群的交叉变异探索,以及文本梯度方法。2025年Nature上的TextGrad把自然语言反馈直接看作"文本梯度"回传,无需计算真实loss就能让优化信号沿语言系统传播,指导Prompt和中间组件迭代。
记忆进化从记什么、怎么组织、怎么处理三个角度展开。组织形式从平铺存储发展到层次化(区分常识与短时记忆)乃至图结构。处理机制则涉及创建、读取、更新与删除——如同人类记忆需要适当遗忘。代表工作让记忆从静态存储变为随新经验持续组织、更新、连接的动态系统。
工具进化分为工具路由(自主选择所需工具)、工具打磨(修改不顺手的工具)与工具创造(现有工具不够用时造新工具)。2025年的相关工作可把发现的代码与能力标准化成可复用工具,让原本一次性的解决方案沉淀进工具库供后续复用。
全脚手架进化则把模型参数以外的一切都视为可修改程序,重构工作流与控制逻辑,难度最大但可干预空间也最大。最典型的任务是Coding Agent。顾教授团队在哥德尔机基础上的ICLR工作,把Coding Agent整个脚手架作为可进化程序,通过评估修改节点的长期潜力来设计进化策略。

脚手架进化的优势在于快速灵活、修改显式易检查,用户可随时介入,还能回滚到上一版本;而全脚手架修改则走向更深层的自省式结构重构。
TextGrad 是理解"文本梯度"这一新范式的重要参照。传统深度学习中,梯度是损失函数对参数的偏导数,以数值形式通过链式法则逐层反向传播,指导参数更新。TextGrad将这一思想迁移到语言系统:当某个组件(如Prompt、推理步骤或代码片段)产生不理想输出时,由LLM生成自然语言批评作为"文本梯度",并将该批评逆向传递给上游组件,指导其修改。这样即便整个流程不可微分、没有真实标签,优化信号也能以语言形式在各组件间流动。其核心价值在于将"反向传播"的适用范围从连续参数空间扩展到了离散的语言空间,使得Prompt、记忆内容、工具描述等原本无法用梯度优化的组件也能接受系统性的迭代改进。
核心瓶颈:如何验证改进是否有效
在问答环节,顾教授明确指出当前自进化最大的瓶颈在于验证改进是否有效。在Coding这类封闭、可执行、可量化的任务中,改完测题即可判断优劣;但在开放式任务中,往往很难当下判断本次改进是否优于上一次,评测本身既复杂又昂贵。即便是封闭的Coding任务,在整个benchmark上评估改进的代价也远高于提出改进本身,涉及真实环境(如机器人)交互时验证成本更是陡增。
另一个被讨论的问题是改进的时效性:某次在t时刻验证有效的改进,可能到t+1、t+2后反而带来负增益。这要求系统具备回滚能力——能判断历史改动对未来是否仍然有益,并在必要时及时退回。顾教授坦言,团队最初做综述时几乎没看到这类工作,但这确实是应当重视的重要方向。
验证难题在强化学习领域有深刻的历史渊源,对应的是奖励稀疏性(Reward Sparsity)与评估者偏差(Evaluator Bias)问题。在封闭任务中,执行结果即时可观测,奖励信号密集清晰;而在开放式任务中,奖励往往稀疏甚至缺失,必须依赖模型自身或另一模型充当"裁判"(Judge/Critic)。然而当改进者与评估者来自同一模型家族时,存在"自我服务偏差"——模型倾向于给自己打高分。此外,在自进化场景下还叠加了分布漂移问题:随着Agent能力演化,其行为分布发生变化,早期评估基准可能不再适用,导致"测量的是旧自我"而非当前能力。这正是回滚机制与持续评估基准设计成为关键研究议题的根本原因。
协同进化与未来方向
对于脚手架与参数是否要分层学习,顾教授认为综述之所以分开划分是为便于理解,实际上二者可交替迭代:脚手架进化资源少、速度快,可先行探索;当积累的Prompt、记忆库变得过于冗余、经验"快要爆炸"时,再将这些外部约束蒸馏内化到模型参数中。这与大模型自身的演进逻辑一致——模型能力越强,所需的提示和上下文就越精简。
综述给出的应用适配原则是:当Agent能获得可执行、可量化的反馈时,自改进最为适用。展望层面,测试时持续适应、好奇心驱动的主动探索、参数与脚手架的协同进化及其归因、有限资源约束下的成本-收益权衡、多智能体、以及开放世界中的分布漂移应对,都是值得深入的方向。而安全漂移与失控、探索成本与收益的权衡、可靠的内部评估裁判,则被列为最关键的研究议题。
顾教授团队维护着持续更新的GitHub仓库,按章节分类整理相关工作,欢迎社区共同补充维护。
相关推荐

为什么大模型应用离不开LangChain?框架入门核心概念详解
为什么会调 API 还要学 LangChain?本文从工程化落地角度解析 LangChain 的核心价值,详解提示词模板、Chains、Memory、RAG、Agent 五大模块及企业真实应用场景,帮你理清从调 API 到做产品的关键差距。

AI Agent开发入门指南:为什么它是下一个技术风口
AI Agent被视为软件行业的下一次范式革命。本文解析Agent与通用大模型的区别、群体协同前沿探索、市场增长数据及入门路径,并介绍一套基于LangChain的零基础Agent开发学习方案。

PluginX智能体租房实测:一键生成房源报告告别手动刷APP
B站UP主实测PluginX智能体租房:用一条自然语言指令即可筛选成都双流区房源,自动生成含租金、地铁距离、周边配套的结构化报告,支持二次筛选与平台跳转,为打工人找房大幅提效。