循环工程详解:让AI自己给自己提示的编程新范式

从写提示词到构建循环:AI使用方式的范式转变
当下全球顶尖的AI用户和程序员正在热议一个新概念——循环工程(Loop Engineering),有时也直接简称为「循环」。Claude Code的创造者Boris Cherny和OpenClaude的创造者Peter Steinberger都在谈论它,并表示他们现在就是这么编程的:不再只是给聊天机器人写提示词,更不会手写代码,而是构建这些循环,让AI自己给自己提示。
这听起来有些抽象,甚至让人困惑。本文将系统拆解「循环工程」究竟是什么、如何运作、擅长什么、不擅长什么,并通过一个完整的实战案例和多个应用场景,帮你理解这一被称为「未来的AI使用方式」的新范式。
值得说明的是,循环工程通常在编程语境下被讨论,但它的应用远不止于此——内容创作、市场调研、自学新技能都能用上。虽然它最终要通过Claude Code或Codex这样的工具来运作,但你并不需要精通技术才能操作。
循环工程的技术背景
循环工程的概念并非凭空出现,它建立在近两年智能体(Agent)架构快速成熟的基础上。2023年以来,从AutoGPT、BabyAGI到MetaGPT,业界不断探索让大语言模型自主规划和执行复杂任务的方案。Claude Code是Anthropic推出的编程智能体工具,允许开发者在终端中直接与Claude对话完成代码编写、调试和重构;OpenAI的Codex则是其代码生成模型的商业化产品。这些工具的共同特征是:它们不再是简单的问答接口,而是具备文件系统访问、命令执行和多步推理能力的自主智能体,这为循环工程提供了技术底座。正是因为智能体可以「读写文件 + 执行命令 + 多步推理」,循环才有了运转的基础设施。
旧方法 vs 新方法:为什么循环工程更高效
传统提示词迭代方式的局限
旧方法的流程是这样的:作为人类,你写一个提示词发给智能体,它执行任务并产出结果,然后你审阅、再写下一个提示,它再产出……如此往复。你确实在迭代,但这个过程完全依赖人工介入,每一步都要等你,效率极低。这种方式在学术上被称为「人在环中」(Human-in-the-loop),它的瓶颈不在于AI的处理速度,而在于人类的响应时间和注意力带宽。当任务复杂度上升,需要几十甚至上百轮迭代时,人类就成了整个系统最慢的组件。
循环工程的核心结构
新方法则截然不同,它的宏观结构包含五个关键环节:
- 目标设定:由人类一次性设定一个明确目标
- 探索阶段:智能体自行找出需要做什么,制定计划,拆解成清晰步骤
- 并行执行:可以同时启动多个智能体(比如15个),每个负责一件事
- 验证环节:由验证智能体检查目标是否达成,达成则发布,未达成则继续迭代
- 记忆系统:独立于对话之外运行,实时追踪进展、记录已完成的步骤

其中「记忆」是极为关键的一环。这套系统独立于对话窗口运行,实时追踪当前进展、记录哪些步骤已经完成,正是这套记忆机制让智能体们能够顺利迭代下去,而不会在多轮循环中重复或迷失方向。
记忆系统的技术实现
从技术角度看,记忆系统解决的是大语言模型的上下文窗口限制问题。即便当前最先进的模型(如Claude 3.5的200K token窗口、Gemini的100万token窗口),在多轮长期任务中仍然会遇到信息丢失或「遗忘」早期指令的情况。循环工程中的记忆通常通过外部文件(如Markdown日志、JSON状态文件)、向量数据库(如Pinecone、ChromaDB)或结构化数据库来实现持久化存储。例如,Claude Code中的CLAUDE.md文件就是一种简单但有效的记忆机制——它在每次会话开始时被自动加载,让智能体「记住」项目背景和既往决策。这意味着即使对话窗口被关闭、token用完需要开启新会话,智能体依然能无缝接续之前的工作。
协调者智能体与专业智能体的分工
一个典型的循环工程工作流是:首先有一个**协调者智能体(Orchestrator)**统览全局,向各个专业智能体分配任务;每个专业智能体独立进行自己的探索循环;最终所有结果汇聚起来,形成完整成果。
这种架构模式借鉴了分布式计算中的主从架构(Master-Worker)思想。在软件工程中,这类似于微服务架构中的服务编排器(如Kubernetes的控制平面),负责任务调度、状态监控和故障恢复。在AI领域,Anthropic在其官方文档中将其称为「编排工作流」(Orchestration Workflow),Google的Vertex AI Agent Builder和微软的AutoGen框架也都实现了类似的多智能体协调机制。核心挑战在于如何让协调者准确判断子任务的完成质量,以及在子任务失败时如何优雅地降级或重试,而不是整个系统崩溃。
验证环节的工程实践
验证智能体的设计借鉴了软件工程中的测试驱动开发(TDD)和持续集成(CI)理念。在实际实现中,验证可以分为多个层次:语法层面的验证(代码能否运行、HTML是否合规)、功能层面的验证(是否满足需求规格)、质量层面的验证(输出是否达到预设标准)。常见的实现方式包括:让另一个LLM实例作为「评审者」打分、运行自动化测试套件、检查输出是否符合JSON Schema等结构化约束。这种「生成-验证」的对抗性架构类似于GAN(生成对抗网络)的思想——生成器负责创造,判别器负责挑错,通过内部博弈逐步提升输出质量。
开环与闭环:如何控制AI循环的成本
循环分为两种:开环和闭环。
开环循环范围极其宽泛,本质上就是告诉智能体「你自己去探索,看看该做什么,然后动手干」。它的魅力在于智能体可能会发现一些你根本想不到的东西。但代价是消耗大量token——因为它可以朝任何方向发展,即使完成了一个方向也会转向另一个方向不停继续。正如原视频所调侃的:「如果你在Meta上班,预算无限,那开环方案很完美。」
闭环循环则从明确目标出发。你事先看清路径、了解智能体可能采取的行动,每一步都有清晰的评估标准。这样预算就能保持相对可控,不至于失控烧钱。对大多数人来说,闭环是更务实的选择。
Token消耗与成本模型详解
要理解开环和闭环的成本差异,需要先理解token的计费逻辑。Token是大语言模型处理文本的基本计量单位,一个英文单词通常对应1-2个token,中文一个字约1.5-2个token。当前主流模型的API定价按输入/输出token分别计费,例如Claude 3.5 Sonnet约为每百万输入token 3美元、输出token 15美元,GPT-4o约为每百万输入token 2.5美元、输出token 10美元。
开环循环之所以特别烧钱,是因为存在「上下文膨胀」效应:每一轮探索都会生成大量中间推理文本,而这些文本在后续轮次中又作为上下文被重新输入模型,形成指数级的二次消耗。一个不加限制的开环循环单次运行消耗数十万甚至上百万token是常见情况,折算下来可能意味着一次运行就花费数十美元。相比之下,设计良好的闭环循环通过明确的终止条件和精简的上下文管理,可以将单次运行成本控制在几美元以内。
实战演示:用循环工程自动做大一家电商
为了让概念具体化,这里给出一个贴近生活的案例:假设你经营一家在线匹克球(Pickleball)装备商店,有一些客户但规模不大,你想把生意做大。整个方案由三个智能体构成,同时运行:
匹克球是北美增长最快的运动之一,2023年美国参与者已超过4860万人,年增长率约30%,这意味着这是一个正在快速膨胀的细分市场,非常适合用自动化营销工具来抢占增长红利。
智能体一:建造者(Builder)
负责搭建一个BuzzFeed风格的趣味测试——「根据你最喜欢的哈利波特角色推荐一款匹克球拍」。这类内容看似无厘头,却极易被分享传播。提示词要求它生成一个可独立运行的HTML文件,包含六个有趣的问题,巧妙对应到进攻型、策略型、社交型、防守型等打球风格,最后在揭晓结果前弹出邮箱收集表单。

这种策略在数字营销中被称为互动内容营销(Interactive Content Marketing),其核心原理是通过游戏化体验降低用户参与门槛,同时利用人们分享个性化结果的心理动机实现病毒式传播。据Demand Gen Report数据,互动内容的转化率比静态内容高出2倍以上,邮箱收集率可达30-50%——远高于传统弹窗的3-5%。
实测中,这个测试一次成型即可上线。用户回答几个问题后输入邮箱,就能获得「霍格沃茨风格剖析」和匹配的球拍推荐。虽然成品带着明显的「AI味」、并不完美,但作为一个可分享的引流工具已经足够。
智能体二:侦察兵(Scout)
负责内容调研,去挖掘潜在客户当前在讨论什么。它会搜索Reddit相关板块、竞争对手网站、搜索趋势和YouTube,根据受众规模、购买意向、内容缺口、测试/引流潜力等维度打分,最终输出排名前八的内容机会。

它给出的机会包括「我的球拍合规吗」「终极装备升级指南」「新手入门套件测试」「女性装备内容」等,并将结果记录到日志文件,方便回溯每一步进展。这种将调研结果写入持久化文件的做法,正是前文所述记忆系统的具体应用——下一个循环周期的智能体可以直接读取这些日志,在已有发现的基础上继续深入,而不是从零开始。
智能体三:增长智能体(Growth Agent)
它会等前两个智能体完成后再行动,整合所有产出、转化为可直接使用的营销素材,包括四项任务:网站链接审计(找出适合放置测试链接的位置及具体文案)、发布邮件(含主题、预览文本、正文、CTA)、社交媒体文案(分别为Instagram、Reddit、Facebook群组定制,符合各平台调性)、以及下一个测试的推荐。实测中它给出了12个网站投放位置建议和多平台文案,质量相当扎实。
用总调度智能体让循环自动运转
如果不想亲自协调,可以设置一个总调度智能体来管理这个三人团队:它先检查outputs/next_steps记忆文件了解上一周期进展,再分配任务、监控输出、整合成统一行动计划,最后进入循环评估三个条件——是否至少有三个未执行的内容创意?网站是否已和测试功能打通?下一个引流钩子是否确定?条件未满足就继续循环。再配合每周自动运行的日程(可通过cron定时任务或GitHub Actions等CI/CD工具实现),整个增长引擎就能自己「滚雪球」般运转。
这种设计体现了闭环循环的精髓:三个明确的退出条件就像三道「闸门」,确保循环不会无限运行下去,每周的token消耗都在可预测的范围内。
四个日常应用场景:循环工程无处不在
循环工程远不止用于电商。以下是四个可套用的现实场景:
自由设计师的客户管理:每周五下午自动运行,读取项目文件夹变化,加载记录了各客户名字、目标、沟通语气的技能文件,起草个性化进度更新并放入审核文件夹待人工把关。这里的「技能文件」本质上就是系统提示词的外部化存储,它让同一套循环能为不同客户生成截然不同风格的沟通内容。

备考学生的信息整理:每周日睡觉时运行,搜索所学领域过去一周最重要的五个进展,按相关度打分过滤,用大白话写成简报,并对比过去三周避免重复。这个场景展示了记忆系统的另一个价值——通过比对历史输出避免信息冗余,这是单次提示词交互无法实现的。
网店店主的转化优化:每月一号运行,读取销售数据,找出流量高但转化低的三个产品重写描述,并为爆款撰写推广文案,记录每次更改的原因。记录更改原因不仅便于人工审核,更让下一个月的循环能够评估上次优化是否有效,形成真正的闭环反馈。
YouTube创作者的选题规划:每周一早上运行,读取创意列表、拉取过去90天表现数据、结合当前趋势打分,输出排名前五的选题,并标注竞争对手已做过的。
冷静看待:循环工程的局限性
值得强调的是,循环工程虽强,但AI并不完美。以YouTube选题为例,作为长期做视频的创作者,原作者坦言AI「并不总能准确判断什么话题好什么不好」。因此你仍需保持批判性思维,把循环当作快速浏览大量创意与建议的辅助工具,再叠加自己的判断,而非全盘依赖。
此外还有几个需要注意的现实限制:首先是幻觉问题——AI可能在调研阶段生成不存在的数据或引用,验证环节虽能捕捉部分错误,但无法完全杜绝;其次是工具调用的不稳定性——智能体在访问外部网站、API时可能遇到访问限制或格式变化,导致循环中断;最后是评估标准的模糊性——当任务涉及创意质量、品牌调性等主观判断时,验证智能体的评分标准很难做到精确,仍需人类在关键节点介入把关。
结语:如何开始搭建你的第一个循环
循环工程代表了从「手写提示词」到「构建自动化循环」的思维跃迁。它的核心是:人类设定目标、AI自主探索执行、验证智能体把关、记忆系统贯穿始终。只要你拥有Claude或Codex的订阅,现在就可以动手搭建自己的第一个循环。
具体的起步建议是:从一个你每周重复做的小任务开始(比如整理笔记、写周报),先设计一个单智能体的闭环循环,明确输入文件、输出格式和终止条件;等你对循环的行为模式有了直觉后,再扩展为多智能体协作。不要一上来就追求复杂的编排——最好的循环往往是从最简单的版本逐步演化而来的。
这或许正是未来大多数人使用AI的方式——不再逐条对话,而是编排一整套能自我迭代的智能体系统。
核心要点
相关推荐

RisenX详解:DeepSeek官方推荐的编程智能体
RisenX是DeepSeek官方API文档收录的原生编码智能体,支持缓存优先循环、工具调用修复和Flash/Pro智能切换。本文详解其核心设计、安装配置和完整功能。

ChordViz评测:MIDI与音频实时可视化工作台
深度解析ChordViz音乐可视化工具,支持实时MIDI与音频输入,提供和弦可视化、乐谱记谱及音频响应视觉三种模式,可集成OBS、TouchDesigner与Resolume,适合音乐教师与现场表演创作者。

3D打印机器人台灯:如何让机器像皮克斯角色一样有生命感
探索一位独立开发者如何用3D打印、ROS 2和自制动画编辑器,将皮克斯经典小台灯变成真实的机器人角色。从硬件外壳设计到动画编排,再到强化学习驱动的自主行为,完整解析这个融合机械、视觉与AI的开源机器人项目。