复利改进系统:AI自我优化的底层逻辑与实践路径

AI领域正在发生什么?
如果要用一句话概括当下AI领域最令人兴奋的变化,那就是:我们正在进入一个可以让系统自我优化、持续逼近目标的时代。这不再是科幻构想,而是正在被工程化落地的现实。
最近一段来自YouTube的分享点出了这个核心趋势——通过定义一个明确的目标,再定义如何评估当前状态与目标之间的距离,然后让系统在循环中不断"爬坡"(hill climbing)逼近目标。这套听起来简单的机制,正在成为新一代AI应用的底层逻辑。

什么是复利改进系统?
所谓复利改进系统(compounding improvement systems),本质上是一个自我迭代的闭环。它包含三个关键要素:
定义清晰的目标
系统首先需要一个明确的目标。这个目标可以是写出一段能通过测试的代码、生成一份满足特定标准的文档,或是完成某个复杂的多步骤任务。没有明确目标,后续的一切优化都无从谈起。
定义评估方式
这是整个机制中最关键、也常被忽视的一环。你不仅要知道目标是什么,还要能够量化当前结果与目标之间的差距。正如原始分享中所说,"you define how to evaluate your proximity to the goal"(定义如何评估你与目标的接近程度)。有了这个评估函数,系统才能判断每一次迭代是变好了还是变坏了。
评估函数(Evaluation Function)的设计是复利改进系统中技术含量最高的环节。在实践中,评估函数通常有几种主流设计路径:一是基于规则的硬编码评估,例如代码是否通过单元测试、生成的JSON是否符合schema,这类评估确定性最高;二是使用另一个LLM作为"裁判"(LLM-as-Judge),让模型按照预设的评分标准对输出打分,这种方法灵活但引入了评估本身的噪声;三是混合评估,将确定性指标与模型主观评价相结合。评估函数设计的核心挑战在于:如何将人类对"好结果"的模糊直觉转化为可计算的数值信号。一个设计不当的评估函数可能导致系统朝错误方向优化——这正是Goodhart定律所警示的:"当指标变成目标时,它就不再是好指标"。因此,评估函数的迭代和校准本身也需要人类专家的持续参与。

在循环中持续爬坡
有了目标和评估标准,剩下的就是让系统进入一个循环——不断生成、评估、修正,一步步向目标靠近。这正是爬山算法(hill climbing)思想在大模型时代的复活。系统每一轮迭代都在前一轮的基础上改进,改进会像复利一样累积,最终产出远超单次生成的结果。
爬山算法是计算机科学中一种经典的局部搜索优化算法,属于启发式方法的一种。其核心思想是:从一个初始解出发,每次向"邻域"中评估值更优的方向移动一步,直到无法再找到更优的邻居为止。这一算法的优点是实现简单、计算开销低,但也存在容易陷入局部最优解(local optima)的经典缺陷。在大模型时代,由于LLM本身具备强大的生成多样性和上下文理解能力,每一步"邻域搜索"的质量远高于传统算法,因此局部最优的问题被显著缓解。结合温度采样(temperature sampling)、多路径探索等技术,现代AI系统可以在爬山过程中兼顾探索与利用(exploration vs. exploitation),实现比传统爬山算法更鲁棒的优化效果。
为什么复利改进系统现在才成为可能?
这套理念其实并不新鲜。分享者坦言,这是"something we thought was possible maybe like 10 years ago"(大约十年前我们就认为这是可能的)。那为什么直到今天才真正落地?
答案在于token变得更便宜、也更强大。

过去,让模型反复迭代意味着高昂的计算成本和有限的推理能力。一个需要成百上千次循环的任务,在经济上和技术上都不现实。而如今,随着大模型推理成本的持续下降和能力的大幅提升,把模型放进一个循环里反复调用,已经成为一件既可行又经济的事情。
这种成本暴跌源自多重因素的叠加。在硬件层面,NVIDIA H100/H200等专用AI芯片的算力密度持续提升;在架构层面,Mixture of Experts(MoE)、推测解码(speculative decoding)、KV-cache优化等技术大幅降低了推理时的计算量;在商业层面,OpenAI、Anthropic、Google、DeepSeek等厂商的激烈竞争加速了价格下降。以GPT-4为例,2023年初其API定价约为每百万输入token 30美元,而到2025年,同等甚至更强能力的模型价格已降至不到1美元/百万token,降幅超过97%。正是这种"摩尔定律式"的成本下降曲线,让在循环中反复调用模型从经济上的奢侈变成了工程上的常规操作。
换句话说,成本的下降解锁了架构的可能性。当每一次调用都足够便宜、足够聪明,把智能"堆叠"起来实现复利效应就顺理成章了。
复利改进系统对开发者意味着什么?
对于开发者和产品构建者而言,这一趋势指向了几个清晰的方向:
- 不要依赖单次调用的完美输出。与其追求模型一次生成就完美,不如设计一个能自我评估、自我修正的循环系统。
- 评估函数是核心竞争力。谁能设计出更精准的评估机制,谁就能让系统更快、更稳地逼近目标。这可能比模型本身的选择更重要。
- 拥抱迭代思维。AI应用的构建正在从"提示词工程"走向"系统工程",重点从写好一个prompt,转向搭建一个能够持续改进的闭环。
这场从"提示词工程"到"系统工程"的范式迁移值得深入理解。2023年前后,"提示词工程"(Prompt Engineering)一度被视为使用大模型的核心技能,从业者投入大量精力打磨单条提示词的措辞、格式和Few-shot示例。然而随着模型能力的提升和应用复杂度的增加,系统工程思维开始全面取代提示词优化。系统工程关注的不是单次交互的质量,而是整个流水线的鲁棒性:如何编排多个模型调用(orchestration)、如何在失败时优雅降级(graceful degradation)、如何设计有效的反馈回路(feedback loop)、如何管理状态和记忆(state management)。LangChain、LlamaIndex、CrewAI等框架的兴起正是对这一趋势的响应。这意味着AI应用开发者的核心能力正在从"写好一段prompt"转向"设计好一个系统"——这需要软件架构、分布式系统、质量保障等传统软件工程的深厚积累。

这也解释了为什么近来大量AI Agent、自动化编程工具都采用了"生成-测试-修正"的循环模式。它们背后的哲学是一致的:让系统在低成本的迭代中,自动爬向更好的结果。
从Devin、Cursor到AutoGPT,这些AI Agent工具的共同架构特征是"行动-观察-反思"循环(Act-Observe-Reflect Loop),也被学术界称为ReAct范式。Agent在执行任务时会先生成一个计划,然后逐步执行,在每一步观察执行结果(如代码运行的报错信息、网页返回的内容),再基于观察结果反思并调整下一步行动。这与传统的单次prompt调用有本质区别——它将AI从"应答机器"升级为"问题解决者"。OpenAI的函数调用(function calling)、Anthropic的工具使用(tool use)等API能力,都在为这种循环架构提供基础设施支撑。值得注意的是,Agent的循环次数和深度也带来了新的工程挑战,包括上下文窗口管理、错误累积控制、以及何时终止循环的策略设计。
结语
"复利改进系统,这就是正道(this is the way)"——分享者用这样一句话收尾,颇有几分宣言的意味。
在模型能力和成本双重利好的今天,AI的价值创造方式正在从"一次性生成"转向"持续性优化"。理解并善用复利改进系统,或许是每一位AI从业者需要建立的核心思维方式。定义目标、量化评估、循环爬坡——简单的三步,蕴含着构建强大AI自我优化系统的钥匙。
核心要点
相关推荐

WAIC产业观察:AI落地开始算ROI,企业如何选对第一个任务
2026 WAIC释放明确信号:AI竞争从模型比拼进入生产系统建设阶段。本文拆解算力、Agent、具身智能三层落地路径,提供企业AI项目ROI评估框架、权限逐级开放策略和好任务五个特征,帮助企业从一个能算清账的任务开始落地AI。

DeepSeek Harness:让AI真正干活的智能体框架
深入解析DeepSeek Harness开发者预览版,一个将AI模型变为可执行任务智能体的开源框架。详解其插件化架构、Codis内核、四种运行模式及快速上手方法,助开发者构建稳定可控的AI Agent。

拒绝AI成为差异化定位:反AI潮流背后的工程理性
当AI成为营销标签时,有人选择公开宣称从不使用AI。本文分析反AI立场背后的工程理性、隐私顾虑与可靠性考量,探讨技术选型应回归解决问题本质而非追逐风口。