斯坦福AI课:三种反馈机制让智能体自我进化

大语言模型擅长解决自然语言处理问题,我们大多数人也熟悉在聊天机器人场景中使用它们。但要让模型在真实世界任务中真正发挥作用,它们需要能够与真实环境、工具和代码交互,并从交互中学习。
大语言模型的能力边界与智能体范式
大语言模型(Large Language Models, LLMs)通过在海量文本数据上进行预训练,掌握了丰富的语言知识和推理能力。然而,纯文本训练存在固有局限:模型的知识截止于训练数据的时间点,无法感知实时信息;缺乏与物理世界的交互经验,容易产生脱离现实的幻觉(hallucination)。智能体(Agent)范式应运而生——它将LLM作为"大脑",赋予其感知环境、使用工具、执行动作的能力,从而突破纯语言模型的边界。智能体通过感知-决策-行动的闭环,能够完成预订机票、编写并调试代码、操控机器人等复杂任务,这代表了从"语言理解"到"具身智能"的关键跃迁。
斯坦福AI智能体课程第四讲聚焦于三篇代表性论文,系统性地探讨了智能体如何通过不同来源的反馈实现自我进化:ReAct(推理与行动的结合)、RLEF(基于执行反馈的代码生成)以及Constitutional AI(模型自我批评的反馈循环)。这三种技术的核心区别在于——反馈从何而来:来自与环境的交互、来自某种批评机制,或来自我们已知的正确答案作为基准。
ReAct:让模型学会边思考边行动
人类在采取行动前会先思考。比如决定是否来上一门课,你会先想它对你有什么帮助,有了理由后再行动,然后基于观察产生新的推理——喜欢或不喜欢这门课,从而决定下一步。这种"思考-行动"的循环是人类运作的基本方式,同样也能有效地精炼语言模型的输出。
在ReAct出现之前,语言模型很难将推理与行动作为孤立过程结合起来。核心挑战在于幻觉问题:模型对环境中实际发生的事情缺乏认知。如果你问Gemini、ChatGPT或Claude"今天的温度是多少",除非它真正执行一次搜索调用来获取信息,否则它对当前事件毫无概念——缺乏对真实世界的锚定(grounding)。
语言空间中的推理-行动循环
ReAct提出的抽象非常简洁:通过提示让模型生成口头推理轨迹。先让模型"逐步思考",得到推理轨迹后追加到提示中,再询问应基于此采取什么行动,然后执行动作。关键在于,这些思考发生在语言空间中,本身不影响环境,但能引导模型生成有效的行动。
思维链prompting技术
思维链(Chain-of-Thought, CoT)是2022年Google提出的突破性提示技术。核心思想是在提示中加入"Let's think step by step"或提供推理示例,引导模型输出中间推理步骤,而非直接给出答案。这种方法显著提升了模型在数学推理、常识问答等复杂任务上的表现。例如,对于"Roger有5个网球。他又买了2罐网球,每罐3个球。他现在有多少个网球?"这类问题,CoT会让模型输出"原有5个→买了2罐→每罐3个→2×3=6个→总共5+6=11个",而非直接蹦出答案。自一致性(self-consistency)是CoT的增强版本:对同一问题生成多条推理路径,通过多数投票选择最终答案,进一步提升准确率。

这种交替进行的方式(思考1→行动1→思考2→行动2)非常类似人类过程:你口渴了,走向厨房,发现没水了,于是决定去超市。每一步都在为下一步提供信息。以HotpotQA中的问题为例——"除苹果遥控器外,还有什么设备能控制它最初设计交互的程序?"——单纯的标准提示或思维链都无法给出正确答案,但ReAct通过搜索"Apple Remote"、发现它控制"Front Row"媒体中心、再搜索"Front Row software",最终得出准确回答。
HotpotQA与Fever基准数据集
HotpotQA是斯坦福2018年发布的多跳问答数据集,问题需要整合多个维基百科文档中的信息才能回答,考验模型的推理链构建能力。例如典型问题需要先识别实体A,再查找与A相关的实体B,最后回答关于B的问题。Fever(Fact Extraction and VERification)是事实核查数据集,包含18.5万条声明,每条需判断"支持/反驳/信息不足"并提供维基百科证据。这两个数据集的共同特点是:单纯依赖模型参数化知识无法解决,必须检索外部知识源并进行多步推理,因此成为评估ReAct等智能体方法的标准测试平台。它们代表了从封闭域QA到开放域知识密集型任务的演进。
ReAct的效果与局限
实验结果显示,ReAct在事实核查任务Fever上优于思维链,但在HotpotQA上并非总是胜出。真正强大的组合是ReAct与思维链自一致性(self-consistency)的回退机制——当ReAct在若干步后失败时回退到思维链,或反之。这说明恰当地结合模型内部知识与外部知识具有明确价值。
在决策任务WebShop(让智能体根据用户指令购买商品)中,ReAct得分66.6,显著超越模仿学习与模仿学习+RL的基线,但仍远低于人类专家的82.1。多步过程中的错误会随时间级联放大,这是成功率偏低的主要原因。此外,ReAct在动作空间过大时需要大量演示,且多步推理带来更高的推理成本。

你可能没注意到,今天的开源模型(如Qwen的思考模式)已经"内化"了这种能力——它们已在这类轨迹上被蒸馏训练,工具调用和推理已成为开箱即用的能力。
模型蒸馏与能力内化
模型蒸馏(Knowledge Distillation)是将大型"教师模型"的能力转移到小型"学生模型"的技术。在智能体领域,蒸馏具有特殊意义:将复杂的推理-行动模式直接编码进模型权重,使其无需显式提示即可展现智能体行为。例如,Qwen2.5等开源模型通过在大量ReAct风格轨迹上训练,习得了"生成推理→调用工具→解析结果→继续推理"的模式,工具调用成为自然输出的一部分。这种内化带来三大优势:降低推理时的token消耗、减少对提示工程的依赖、提升多轮交互的连贯性。然而代价是灵活性下降——内化的模式难以快速适应新工具或新任务格式。当前研究趋势是混合方法:核心能力蒸馏进模型,具体任务通过提示或微调适配。
RLEF:用执行反馈打造更强的编程智能体
课堂上大部分学生都在使用Claude Code——大量工程和编码任务已被委派给这些智能体。要让编程智能体足够强大,关键是理解用户意图,并从生成的代码中获取反馈以进行迭代。
RLEF是最早证明执行反馈能显著提升编程大模型性能的论文之一。它提供了一个端到端的强化学习微调框架:动作是生成的代码,观察来自执行反馈——运行测试并收集通过或失败的结果,基于此给予二元奖励,再通过PPO进行训练。
PPO算法在语言模型中的应用
近端策略优化(Proximal Policy Optimization, PPO)是OpenAI 2017年提出的强化学习算法,已成为RLHF(基于人类反馈的强化学习)的事实标准。在语言模型微调中,PPO解决了传统策略梯度方法的不稳定问题:它通过限制每次更新的策略变化幅度(用KL散度约束),避免因单次大幅更新导致的性能崩溃。具体流程是:旧策略生成响应→奖励模型打分→计算advantage→用clip目标函数更新策略→重复迭代。PPO的"近端"特性保证了训练平稳收敛,使得ChatGPT等模型能够稳定地从人类偏好中学习。在RLEF中,PPO的奖励信号来自代码执行结果(通过/未通过测试),而非人类标注,实现了自动化的反馈循环。
双层测试策略:公开测试与私有测试
RLEF的核心是迭代反馈循环,同时使用训练时和推理时的执行反馈。模型接收自然语言问题描述后生成代码方案,在公开测试集上评估。若失败,执行反馈会被反馈给模型进行下一次尝试,循环直到通过或达到轮次上限。对于通过的方案,再用私有测试集决定奖励,用于PPO训练循环。
以检测回文子串为例:第一轮生成的基础方案因执行超时在公开测试中失败;收到反馈后,模型生成经过优化的更好方案并通过公开测试;随后提交给私有测试集获取奖励信号。这种公开与私有的分离设计巧妙地防止了模型简单记忆测试输出,因为它获得的是执行反馈而非答案本身。
RLEF为什么有效
实验显示(尽管基于较老的LLaMA 3.1模型),在代码竞赛数据上经过RLEF训练后,解题率明显提升,且x轴为对数刻度。基础模型通常无法从错误方案和执行反馈中获益,真正起作用的是——在每一轮展示执行反馈能让模型学会定位错误并修复,这种能力还能泛化到其他基准。
代码竞赛与算法问题求解
代码竞赛(如Codeforces、LeetCode、APPS数据集)是评估编程智能体能力的重要场景。这类问题通常包含:自然语言描述的算法任务、输入输出样例、隐藏测试集,以及严格的时间/空间限制。难度从简单的数组操作到复杂的动态规划、图算法不等。与真实软件工程不同,竞赛问题有明确的正确性标准(通过所有测试用例),非常适合作为强化学习的训练场景——二元奖励信号清晰,且无需人工标注。历史上,AlphaCode是DeepMind 2022年的里程碑,在Codeforces上达到人类参赛者中位数水平。当前Claude、GPT-4等模型在中等难度问题上表现优异,但在需要深度算法洞察的困难题上仍有差距,这正是RLEF等方法试图弥合的能力鸿沟。
消融分析表明,采用RLEF后,随着轮次推进(第一轮、第二轮、第三轮),错误输出越来越少,模型开始进行有针对性的修复;而没有迭代循环的模型则无法做出正确的编辑。这既利用了更高的样本多样性,也实现了更精准的修改。
课堂讨论也指出了局限:二元奖励可能只适用于较简单的问题,对于更复杂的问题,可能需要错误追踪或其他元数据才能更高效地调试。过程奖励模型与结果奖励模型孰优孰劣,在不同领域和基准上仍是未解的开放问题。
Constitutional AI:让模型从AI反馈中学习
传统构建聊天机器人的反馈方式是收集人类偏好——展示两个输出,让人类判断哪个更正确、更有用、更具体,据此训练奖励模型(即RLHF)。但这种方式扩展性差:收集数万条人工标注极其耗时繁琐。
RLHF的人工标注瓶颈
RLHF(Reinforcement Learning from Human Feedback)是训练ChatGPT等对话模型的核心技术,流程包括:监督微调→收集人类偏好数据→训练奖励模型→用PPO优化策略。然而人类标注存在严重瓶颈:成本高昂(每条标注需多名标注员达成共识)、扩展性差(OpenAI为GPT-4收集了数十万条偏好数据)、主观性强(不同标注员对"有用性"理解不一)、无法覆盖长尾场景。更关键的是,随着模型能力提升,需要更专业的领域专家进行标注,进一步推高成本。Constitutional AI的突破在于:用AI反馈替代大部分人类反馈,人类只需编写高层原则(宪法),之后模型自主生成训练数据。这种"RLAIF"(基于AI反馈的强化学习)范式,将人类参与从"逐条标注"提升到"原则设计",实现了从劳动密集型到知识密集型的转变。
Anthropic提出的Constitutional AI基于一个洞察:既然模型能够推理,就可以用人类编写的原则(宪法)来引导模型自我改进。人类只需编写这套宪法,之后就无需持续参与循环。这之所以奏效,是因为模型的指令遵循能力已足够强——你让它以某种方式格式化回复或判断某回复是否具有某种行为,它都能做到。
自我批评与修订循环
Constitutional AI设计了16条原则构成"宪法"。工作流程是:使用红队提示,观察模型输出,让模型基于宪法批评自己的输出(例如"这个回复是否有害或不道德"、"是否含有性别偏见"、"是否不适合儿童"),获取修订,再用这些修订后的轨迹微调模型。这是监督微调阶段。
红队测试与对抗性提示
红队测试(Red Teaming)源自网络安全领域,在AI安全中指系统性地用对抗性输入测试模型的脆弱性。对于语言模型,红队会设计诱导模型产生有害输出的提示,例如:越狱提示(jailbreak,绕过安全机制)、间接注入(通过看似无害的上下文植入恶意指令)、角色扮演攻击(让模型假装不受限制)等。Anthropic在Constitutional AI中使用红队数据集,包含涉及暴力、歧视、非法活动等主题的提示,专门用来暴露模型的有害倾向。这些数据不是为了训练模型产生有害内容,而是让模型学会识别并拒绝此类请求。红队-蓝队循环(红队攻击、蓝队防御、红队再攻击)已成为AI安全的标准实践,OpenAI、Anthropic等公司均设有专门的红队团队。

随后是强化学习阶段:基于第一阶段的响应和宪法训练一个偏好模型,再用它微调LLM,使其输出最深思熟虑、尊重且得体的回复。这本质上是用一个由宪法训练的偏好模型,替代了RLHF中大量的人类反馈。
有益性与无害性的权衡
结果显示,仅让模型基于这些原则评估自身响应,就能在保持大致相当有益性的同时,大幅提升无害性得分——这正是Claude系列模型的强项。关键发现是:Constitutional AI结合思维链能够达到有益性与无害性权衡的最佳前沿,优于纯RLHF。

讨论中一个有价值的观点是:让模型批评自己有时更困难,因为模型可能对自身认知过度自信,因此采用多个模型的共识来批评往往效果更好。此外,宪法的更新涉及持续学习问题——如何让模型遗忘某些知识或遵循新规则,目前仍是开放研究难题。
总结:反馈循环是智能体自我进化的关键
这三篇论文共同勾勒出智能体自我进化的核心思路——构建有效的反馈循环。ReAct让模型在语言空间中结合推理与行动,通过与真实世界交互实现锚定,产生可解释的决策轨迹;RLEF在编码领域用单元测试作为执行反馈,让模型迭代修复代码;Constitutional AI则用人类编写的原则驱动模型自我批评与改进。
它们的本质区别在于反馈来源,但共同点是:当反馈循环拥有足够的信号时,模型就能超越训练数据本身实现改进。正如讲者所言,我们正在借鉴人类解决问题的方式来设计LLM——分解任务、并行探索、利用记忆与经验——但最终仍要回答一个更深的问题:推理空间中的搜索能否被自动化?对于搜索空间明确的任务(如游戏),答案是肯定的;但对于需要真实环境经验的开放任务,我们仍需在语言空间中收集观察并加以利用。这也正是当前智能体研究最激动人心的前沿。
核心要点
相关推荐

TrustGraph vs Semantica:知识中台图谱引擎选型深度对比
深度对比TrustGraph与Semantica两款开源图谱引擎的架构定位、核心能力与适用场景,提供企业知识中台GraphRAG选型决策树、分层共存方案及三阶段落地路径,助力架构团队做出精准技术决策。

Fable 5.1破解373年历史密码:AI推理能力迎来实战突破
AI评测机构Vals AI宣布其模型Fable 5.1成功破解373年历史古老密码Cyphral Distich。本文深入分析这一事件的技术意义、历史密码破解难点,以及大语言模型在复杂推理领域的真实能力边界。

CGI:首个开源GPU算力价格指数,让算力定价透明化
Computable GPU Index(CGI)是首个开源GPU算力价格指数,以美元/GPU小时为单位,基于固定供应商面板计算,具备数学严谨性和完全可验证性。本文解析CGI的核心特性、算力价格指数的重要性及其金融化想象空间。