AI Agent 工作原理拆解:四步循环与内置工具

Anthropic 将 AI Agent 拆解为「收集上下文→采取行动→验证结果→重复」的四步循环,配合内置工具开箱即用。
Anthropic 对 AI Agent 的定义出人意料地简洁:一个不断重复的四步循环——收集上下文、采取行动、验证结果、再次重复。在 SDK 层面,循环的每一圈被称为一个 turn,Claude 自主决定调用哪些工具,SDK 负责执行并将结果回传,任务结束后还会输出 token 用量与成本。以修复 `auth.ts` 测试为例,Agent 并非一上来就改代码,而是先跑测试确认现状、再读代码定位问题、最后修改并用测试结果验证——完整复现了工程师解决问题的真实思路。支撑这套循环的内置工具涵盖文件读写、搜索、Bash 命令执行、联网以及子智能体调度,开发者无需从头编写即可使用。理解 turn 和四步循环,比堆砌复杂框架更能抓住 Agent 的本质。
AI Agent 的核心:一个循环
很多人把 AI Agent 想得过于复杂,但 Anthropic 给出的定义其实相当朴素——每一个智能体的核心,都是一个不断重复的循环。这个循环被拆解为四个节拍:收集上下文(gather context)、采取行动(take action)、验证结果(verify the work)、再次重复(repeat)。
用一个形象的比喻来理解:一个负责烤面包的机器人会先观察,再烤制,然后闻一闻判断火候,如果不对就再来一遍,直到面包达到理想状态为止。Agent 做的事情本质上就是如此——它不是一次性给出答案,而是通过多轮试探与修正逐步逼近目标。
这种循环结构是 Agent 区别于普通一问一答式模型调用的关键。普通调用只走一次,而 Agent 会根据每一步的反馈持续调整下一步的动作。
一次循环叫做一个 Turn
在 Anthropic 的 SDK 实现里,循环的每一圈被称为一个 turn(回合)。它的运作流程非常清晰:
Claude 读取你的提示词,判断该做什么,然后请求调用工具;SDK 负责真正执行这些工具,并把执行结果喂回给 Claude。如此往复,直到 Claude 认为任务完成。

当整个任务结束后,你会拿到一个最终结果,里面不仅包含答案本身,还包含 token 用量和成本。这一点对实际生产环境尤为重要——它让开发者能够清楚地知道每次 Agent 运行花了多少资源,而不是陷入不可控的黑箱消耗。
值得注意的是,turn 的概念与传统对话中的「轮次」有所不同。在普通聊天场景中,一个 turn 通常指用户说一句、模型回一句的来回。而在 Agent 语境下,单个 turn 内部可能包含多次工具调用——Claude 可以在同一个 turn 里先调用 Bash 跑测试、再调用 Read 读文件、再调用 Edit 修改代码,SDK 会依次执行并将每步结果追加进上下文,直到 Claude 决定不再调用工具为止。这种「一个 turn 内多次工具调用」的机制,是 Agent 能够完成复杂多步骤任务的底层支撑。Token 用量和成本的统计也以 turn 为单位汇总,这使得开发者可以在粒度适中的层面上进行成本监控,既不会细到每次工具调用,也不会粗到整个任务无法拆解。
一个真实案例:修复失败的测试
官方文档给出的例子直观展现了这套循环如何运转。任务很简单:修复 auth.ts 中失败的测试。
- Turn 1:运行测试,发现三个失败项。
- Turn 2:读取代码和测试文件,理解问题所在。
- Turn 3:编辑文件,再次运行测试,全部通过(all green)。

最后 Claude 给出一条收尾消息:「已修复,三个测试全部通过。」

这个过程最值得玩味的地方在于——Agent 并没有一开始就盲目改代码,而是先跑测试确认现状,再读代码定位问题,最后修改并用测试结果来验证自己的工作。这正是「验证结果」这一节拍在起作用,它让 Agent 的输出变得可靠而非一厢情愿。
工具开箱即用,无需自己编写
支撑这套循环的,是一组内置工具。开发者不需要自己从零实现这些能力,它们已经「装在盒子里」:
- 文件操作:Read、Edit、Write,用于读写和修改文件。
- 搜索:Glob 和 Grep,用于匹配文件路径和搜索文本内容。
- 命令执行:Bash,用于运行系统命令。
- 联网能力:Web Search 和 Web Fetch,用于搜索和抓取网页。
- 扩展能力:还包括启动子智能体(subagents)和加载技能(skills)的工具。

这种「内置工具」的设计哲学大大降低了构建 Agent 的门槛。过去开发者需要自己定义工具的接口、处理调用协议、编写执行逻辑,而现在这些常用能力已经标准化并打包好。你要做的只是描述任务,剩下的交给循环去完成。
「子智能体(subagents)」这一能力值得单独说明。在复杂任务中,主 Agent 可以动态启动一个或多个子 Agent,将任务分解后并行或串行地交给它们执行,再汇总结果。这种多 Agent 协作模式类似于软件工程中的「分治」思想——主 Agent 扮演调度者,子 Agent 各自专注于子任务,彼此之间通过工具调用接口通信。这也是为什么「启动子智能体」被列为一种内置工具:从模型的视角来看,调用子 Agent 和调用 Bash 命令在接口形式上是一致的,都是「调用某个工具并等待结果」。这种设计让 Agent 的能力边界可以通过嵌套来无限扩展,而不需要在单一循环中塞入所有逻辑。
为什么这套模型值得关注
把 Agent 的工作原理剥开来看,会发现它并不神秘:一个循环,加上一组可被调用的工具,再加上让模型自己决定何时调用哪个工具的能力。真正的「智能」体现在模型对每一步反馈的判断,以及它持续迭代直到任务完成的能力上。
对于想要构建自己 Agent 应用的开发者来说,理解「turn」的概念和四步循环,比堆砌复杂框架更重要。从运行测试到读代码再到改文件的这个链条,映射的是人类工程师解决问题的真实思路——先观察、再分析、后动手、最后验证。Agent 的价值,正是把这套方法论自动化了。
相关推荐

扎克伯格新片口碑两极,微软Surface全押AI开发
扎克伯格新片《The Social Reckoning》口碑两极,烂番茄68分难复刻《社交网络》。微软发布全押AI开发的Surface Laptop Ultra,起售价2600美元;苹果或携手LG进军智能家居。

Nano Banana 2.1 使用教程:在 Google AI Studio 中快速找到并体验
想在 Google AI Studio 里体验超写实图像模型 Nano Banana 2.1,却找不到入口?本教程详解查找路径:进入 Playground,打开右侧模型选择器,点击 Images 标签即可选中这个付费模型,并附人像生成实测效果分析。

Claude Haiku 5.5发布:最便宜最快的小模型来了
Anthropic发布Claude Haiku 5.5,号称最便宜最快最强的小模型。价格比上一代降约75%,输入每百万token仅10美分,计算机使用能力从16%提升至72%,并首次引入effort成本调节设置。