循环工程:让AI自己执行、检查、修正的完整方法

从写提示词到守流程:一个熟悉的痛点
你可能有过这样的经历:花半天写好一大段提示词,AI回复后,你再逐条挑毛病——这里逻辑不对要重写,那里没有依据得补充,结构太乱又要重排。来回五六轮之后结果确实变好了,但你却一直守在屏幕旁边。
AI帮你省下了打字的时间,却没有省下盯流程的时间。
最近有人喊出"提示词已死",这话有点夸张,但它确实指向了一个明显的转变:过去我们研究的是"这一轮该怎么问",现在更值得研究的是"怎么让AI自己执行、检查、修正、再执行"。据B站UP主三九的分析,这套方法可以叫做循环工程(Loop Engineering)。
为什么循环工程现在才能实现
早期模型的理解和行动能力有限,你只能尽量把角色、背景、步骤、格式全部塞进一段提示词里,靠一次输入决定成败。
但最近一代模型已经能够拆解任务、调用工具、读取结果、发现错误,还能换一种方法继续尝试。这些能力的背后是AI Agent(智能体)技术的成熟。2023年以前,大模型主要以对话形式运行,用户输入一段文本,模型返回一段文本,整个过程是单轮或多轮的文本交互。从GPT-4开始,OpenAI引入了Function Calling机制,允许模型在对话过程中主动调用外部函数——比如搜索网页、读取文件、执行代码、查询数据库。Anthropic的Claude也通过Tool Use实现了类似能力。
Function Calling的工作原理是:开发者在API调用时定义一组函数的名称、参数和描述,模型在对话过程中如果判断需要调用某个函数,会返回结构化的JSON参数而非自然语言文本,由开发者的代码执行实际函数调用后将结果回传给模型。这意味着模型本身并不直接执行代码或访问外部系统,而是通过一种"意图表达+外部执行+结果回传"的三步协议完成工具使用。Anthropic的Tool Use遵循类似的设计哲学,但在实现细节上有所不同,例如支持更灵活的工具链组合。这种架构设计使得AI Agent可以在保持安全边界的同时,具备操作外部世界的能力。
这些能力使得AI不再只是"回答问题的聊天机器人",而是可以执行多步骤工作流的自主代理。既然它已经具备这些动作能力,你就可以把原来手动完成的反馈过程也一起交给它。
循环工程的思想并非凭空而来,它与控制论(Cybernetics)和软件工程中的反馈回路思想一脉相承。早在20世纪40年代,诺伯特·维纳就提出了负反馈控制的概念:系统输出的结果被重新送回输入端,与期望值比较后产生误差信号,驱动系统不断修正。维纳于1948年出版的《控制论》开创了这一领域,其中最经典的例子是恒温器:设定目标温度后,系统不断测量当前温度与目标的差值,据此决定加热或停止。这个看似简单的机制解决了一个根本问题——你不需要精确预测系统在每一刻的状态,只需要定义目标和纠偏规则。在AI领域,强化学习中的奖励信号本质上也是一种反馈机制。循环工程将这种思想从数学模型层面提升到了任务管理层面:验收标准就是"目标温度",检查机制就是"温度传感器",修正动作就是"加热或制冷"。
现代软件开发中的CI/CD(持续集成/持续交付)流水线也是同样的逻辑——代码提交后自动编译、运行测试、发现失败则阻止合并。CI/CD由Martin Fowler和Kent Beck等人在2000年代初系统化提出,一条典型的流水线包括:代码提交触发自动构建、运行单元测试和集成测试、通过静态分析检查代码质量、部署到测试环境进行验收测试、最终发布到生产环境。每个阶段都有明确的通过/失败判定标准(即"门禁"),失败时流水线停止并通知开发者。循环工程的四个部件与此高度对应:目标对应构建产物、验收对应测试用例、检查对应门禁机制、预算对应超时和重试策略。这种类比不仅是修辞上的,更暗示了循环工程可以借鉴CI/CD领域数十年积累的最佳实践。
循环工程本质上是把这套工业级的反馈思维应用到了AI任务执行中:不靠一次完美输入决定成败,而是靠多轮检测-修正趋近目标。
举个例子,你想让AI审查一个网站。如果只说"帮我看看有什么问题",它可能给你十几条建议:有几条能用,有几条很笼统,还可能有几条跟页面完全对不上。这时候质量控制仍然握在你手里,你得追问"具体在哪""哪三项最影响转化""有没有今天就能上线的方案"。
循环工程的四个核心部件:目标、验收、检查、预算
换成循环的写法,任务一开始就要说清楚:读取网站页面和代码,找出至少十个具体问题,标注严重程度和准确位置;给出可执行的修改方案,按收入影响选出前三项;每条建议都要引用网站中已存在的内容;完成后自查一遍,发现空框、事实错误或缺少证据就返回处理;最多尝试十二轮,达到上线标准后停止并汇报。

这套规则里包含四个部分,记住四个词就够了:目标、验收、检查、预算。
目标:明确交付物
最后要交付什么?一份网站审计报告、十个视频选题,还是一张清洗好的数据表?交付物越明确,AI越容易判断任务有没有真正完成。
验收:把标准变成可量化的清单
"写好一点""分析深入一点"都很难检查。换成具体条件:一共多少项、每项有哪些字段、是否要引用来源、按什么规则排序、哪些内容不能出现。这些条件就是AI手里的"尺子"。
这种将验收标准可操作化的做法,借鉴了软件测试中"断言(Assertion)"的思想。断言是自动化测试的基石,最早可追溯到1972年David Parnas提出的程序正确性验证方法。在现代测试框架(如JUnit、pytest、Jest)中,断言是最小的验证单元。一个典型的断言语句如assertEqual(result, expected)会在结果不符预期时立即抛出异常并标记测试失败。断言的威力在于它把"质量"从主观判断变成了二进制结果——要么通过,要么不通过,没有模糊地带。
在循环工程中,这种思维方式尤其重要:当AI对自己的输出进行"自我评价"时,如果没有明确的断言式标准,它倾向于给出"总体不错,但可以改进"这类无法驱动行动的评估。而把验收标准写成可逐条核对的布尔判断——有没有引用来源?数量是否达标?是否包含禁止出现的内容?——就把AI的自我检查从"重新生成一个看起来不同的版本"变成了"逐项比对是否满足既定条件"。
检查:验证而非重生成
一轮完成后,AI要怎么验证结果?可以重新读原始资料查漏,可以跑测试看代码能否通过,也可以对照数据源确认结论有无依据。只让模型再生成一次,往往只得到"另一版答案";加上检查器,每一轮才有机会真正向验收标准靠近。
预算:给循环设边界防止失控
最多尝试几次、最多消耗多少Token、最长运行多久。这里的Token是大语言模型处理文本的基本单位,并非简单等同于一个字或一个词。英文中一个常见单词通常对应1-2个Token,而中文由于编码方式不同,一个汉字可能消耗1.5-2个Token。模型每次调用都会计算输入Token和输出Token的总量,API按此计费。
主流大模型API的计费方式是按输入Token和输出Token分别计价,且输出Token的单价通常是输入Token的2-4倍。以GPT-4o为例,每百万输入Token约2.5美元,每百万输出Token约10美元。一次包含完整上下文的对话可能消耗数千到数万Token。在循环工程中,每一轮循环都需要将之前的结果、检查反馈和原始指令一起发送给模型,这意味着随着循环次数增加,单轮的输入Token量可能线性甚至超线性增长。十二轮循环的总Token消耗可能是单次调用的50-100倍。因此,预算设置不仅是防止逻辑失控,更是直接关系到使用成本的硬约束。
没有边界的循环可能一直重试,额度烧完了质量却没同步提升。所以达到上限就要停,并说清楚完成了什么、还卡在哪里。

内循环与外循环的区别
理解了四个部件,还要区分两种循环:一个管"这次任务的质量",一个管"这件事多久做一次"。
这种内外循环的嵌套关系,在计算机科学中有广泛的类比。操作系统的调度器就是一个典型的双层循环结构:外层循环按时间片轮转调度不同进程,内层循环则是每个进程内部的指令执行周期。在DevOps领域,外循环对应发布周期(每周部署一次),内循环对应每次部署中的构建-测试-修复流程。理解这种嵌套关系的关键在于:外循环决定"何时启动",内循环决定"如何做好",两者职责分明但紧密协作。
内循环:管单次任务质量
内循环解决的是"这次任务怎么做到合格"。还是审查网站的例子:AI读取页面时发现一部分抓取失败,就调整方法重新读取;生成建议后逐条核对,某条没有证据就删除或重写。这些都发生在一次任务内部。
外循环:管任务执行频率
外循环解决的是"这件事多久再做一次"。比如你每天跟踪五个YouTube频道,AI记录新视频的标题、选题、缩略图和播放表现,再把新发现更新到固定文档,每天执行一次。而每次执行时,它内部仍然要读取、分析、检查、修正——外循环里又嵌套着内循环。如果只有外循环(定时执行)而没有内循环(质量检查),就会产出大量低质量结果;如果只有内循环而没有外循环,就需要人工反复触发,无法实现真正的自动化。
在支持相关命令的AI编程工具里,Go、Loop、Schedule分别对应三件事:Go定义任务目标和完成标准,Loop定义循环执行的频率(如每小时或每天),Schedule用来指定准确时间(如每天早上六点执行)。命令可能随工具版本变化,但顺序很稳定:先定任务,再定验收,然后决定什么时候运行。

循环工程能落地的典型场景
结构搭好后,很多工作都能放进去:
- 内容创作与竞品分析:定期收集对标账号的新视频,记录开头卖点、素材形式和评论反馈,分析哪些结构反复出现。
- 团队项目管理:定期整理项目频道的更新,汇总进度、责任人、卡点问题和待决策事项,输出前先核对消息来源。
- 市场研究与情报监控:定时扫描指定信息源,保留原始链接,按影响程度排序。你每天看到的是整理过的增量,不用重复翻遍所有资讯。
循环还能帮AI"学习你的工作方式"。比如训练写作技能,让它定期分析某个账号的新内容,提取文章结构、句子长度、开头方式和论证习惯,把验证过的规律更新到技能文件里。但要注意:学习风格不等于照抄内容。只提取可复用的结构特征,新内容仍然要回到你自己的观点、经历和素材。
AI自动化也要留边界:人工确认节点
再强大的自动执行,也要保留人工节点。付款、发布、删除文件、修改线上系统、对外发送消息——这些动作最好保留人工确认。AI可以把证据、风险和变更内容准备好,停在执行前的最后一步,等你决定。
这一原则在AI安全和人机交互领域被称为"Human-in-the-Loop(人在回路中)",它源自军事和航空领域——自动化系统可以完成大部分操作,但关键决策点必须由人类确认。美国国防部在2012年发布的自主武器系统指令中明确要求,致命性决策必须保留人类判断环节。这一原则被广泛引入到AI产品设计中:自动驾驶中的接管机制、医疗AI中的辅助诊断而非自主诊断、金融AI中的交易审批流程。
在机器学习领域,HITL还有另一层含义:人类标注者参与模型训练过程,通过主动学习(Active Learning)策略,模型将自己最不确定的样本交给人类标注,从而用最少的人工投入获得最大的模型提升。在AI工作流自动化中,HITL的设计关键在于确定"断点"的位置——哪些操作是可逆的(如生成文档草稿),哪些是不可逆的(如发送邮件、执行支付)。可逆操作可以让AI自主完成,不可逆操作则必须设置人工确认断点。这种分类方法为循环工程中的权限设计提供了清晰的决策框架。
循环工程中保留关键操作的人工确认节点,正是这一原则在AI工作流自动化中的具体实践。
创意判断、商业方向和价值取舍同样需要人定期校准。AI能查格式、查事实、查规则,但一条内容是否符合品牌气质、一个机会是否值得投入,仍然需要你来判断。

如何开始你的第一个循环工程实践
如果你想动手尝试,建议从过去一周做过的事里选一件——最好是高频、低风险、有固定输入输出、做错也容易恢复的任务。
然后写下四行:
- 我要什么结果?(目标)
- 怎样才算合格?(验收标准)
- 用什么方法检查?(检查机制)
- 最多运行多少次?(预算边界)
先跑一次内循环,结果稳定后再加定时执行,让它变成外循环。别急着搭一个全天候运行、包办所有工作的AI系统;先让一个小任务稳定转起来,再逐步增加工具权限和范围。每增加一项能力,就补上对应的检查和停止条件。
提示词当然还有用,只是它现在更像"启动工作流的入口"。真正值得练的,是定义目标、设计验收、配置工具、控制权限,以及让系统在失败后安全地再试一次。你不必一直守在对话框前,把反馈写进任务,让AI在边界内自己推进,遇到需要判断的节点再把问题交回来。
从提示词工程走向循环工程,变化就在这里。
核心要点
核心要点
相关推荐

AWS密钥泄露致1000+慈善机构数据失守:机器身份管理的惨痛教训
Beacon CRM因AWS密钥嵌入公开JavaScript文件,导致超过1000家慈善机构敏感数据泄露。本文深入分析机器身份管理的结构性风险,并提供非人类身份生命周期管理的实战建议。

AI研究视频社区平台:解决学术视频碎片化的知识索引新方案
探讨如何构建社区驱动的AI研究视频索引平台,解决学术视频碎片化与检索困难问题。涵盖元数据管理、多维度检索、AI自动摘要等技术实现,以及降低知识获取门槛、促进跨领域交流的价值前景。

用C#和WinForms开发万智牌:一个反直觉的技术选型解析
探讨为什么选择C#和WinForms来实现万智牌卡牌游戏。分析WinForms快速原型优势、万智牌规则引擎的技术挑战、状态管理与事件驱动模型,以及这个开源项目的架构设计学习价值。