Agent沙箱实战:三层架构把软件工厂装进盒子

开发者才是瓶颈:Agent 工程的新拐点
在众多关于 Agentic Engineering 的讨论中,YouTube 频道 IndyDevDan 提出了一个极具冲击力的观点:如果你还在"loop"(循环)之内,那么你自己就是瓶颈。 大多数工程师习惯于在自己电脑的一小块空间里运行 AI 编程 Agent,或过度依赖 CI/CD 流水线和容器。但真正在顶级 AI 实验室跑高强度工作负载的工程师,早已不这么做了。
他们意识到一个简单的事实:Agent 越自主、越安全,它能为你做的事情就越多,且风险为零。这篇文章的核心,就是如何通过将"软件工厂"(Software Factory)放进 Agent 沙箱(Agent Sandbox),让工程师真正走出循环,实现前所未有的杠杆效应。
为什么容器还不够?
很多人会问:既然有 Docker 容器,为什么还需要专门的 Agent 沙箱?IndyDevDan 给出了三个关键理由——真正的隔离(Isolation)、惊人的规模(Scale)、以及自主性(Agency)。
容器确实能提供隔离,但它无法给你规模和自主性。要理解这一点,需要了解容器隔离的技术本质:Docker 容器基于 Linux 内核的 namespaces 和 cgroups 实现进程级隔离,多个容器共享同一个宿主机内核。这意味着容器之间存在内核攻击面,且 CPU、内存、磁盘 I/O 等资源仍在同一台物理机上竞争。对于传统微服务部署,这种隔离级别已经足够。但对于 AI Agent 而言,问题在于 Agent 可能需要执行任意命令、安装依赖、修改系统配置,甚至运行不可预测的代码——这些操作在共享内核的容器中存在逃逸风险。Agent 沙箱通常基于轻量级虚拟机(microVM)技术,如 Firecracker 或 Cloud Hypervisor,在硬件虚拟化层面提供完整的内核隔离,同时保持接近容器的启动速度。
当你把 Agent 限制在自己电脑的"一个角落"时,你在干扰它的工作,它也在干扰你的工作。而 Agent 沙箱的理念是:给每个 Agent 一整台属于它自己的电脑。 就像开发者拥有自己的开发设备一样,Agent 也应该拥有自己的"开发设备"——一台拥有独立内核、独立文件系统的完整虚拟机——从而能够独立、完整地对结果负责。
三层架构:把软件工厂装进沙箱
作者搭建的系统采用了清晰的三层编排架构:
- 外层编排器(Out-Sandbox Orchestrator):运行在本地机器上,负责启动和管理多个沙箱。作者使用 Claude Code 作为顶层编排器。
- 沙箱内编排器(In-Sandbox Orchestrator):运行在沙箱虚拟机内,负责在盒子内部启动具体的工作流。
- ADW 智能体(AI Developer Workflow Agents):真正干活的 Agent,包括规划者、构建者、测试者、文档编写者等,构成完整的软件工厂。

作者强调,这套系统的核心不是"扔一个昂贵的 Claude Opus Agent 上去",而是理解什么模型该在什么地方运行、需要搭配什么代码。这就是软件工厂的本质:非确定性的 Agent 与确定性的代码相结合,取两者之长。这里的"确定性代码"指的就是 Agent Harness——包裹在 LLM 调用外部的控制框架,负责工具调用路由、错误处理、重试逻辑、上下文管理、输出解析和验证等工作。与 LangChain、CrewAI 等通用 Agent 框架不同,harness 工程强调为特定工作流定制精确的控制逻辑,而非依赖通用抽象。LLM 负责创造性决策,harness 负责保证流程的可靠性和可观测性。
技术栈选择
在具体工具上,作者使用了:
- Herder:终端复用工具,用于观察多个 Agent 同时执行任务;
- Claude Code:作为顶层编排器;
- Pi(Agent SDK):作为自定义 Agent Harness,实现"harness 工程"。Pi 不试图做一个万能框架,而是提供一个最小化的脚手架,让工程师能精确控制 Agent 在每个步骤中的行为——这正是 harness 工程理念的体现;
- exe.dev:作为主要的沙箱工具,提供"持久、快速、安全、可共享"的沙箱虚拟机。
作者特别指出,exe.dev 与其他很多沙箱提供商不同——后者往往只给你几小时或几天的时间,而 exe.dev 是一台你真正拥有的虚拟机,可以随意启停。
Best-of-N:同时探索多个可能性
整篇实测最精彩的部分,是 Best-of-N(N选优) 模式的演示。Best-of-N 是机器学习中一种经典的推理时计算扩展(inference-time compute scaling)策略。其核心思想源于统计学:如果单次采样的成功概率为 p,那么 N 次独立采样中至少有一次成功的概率为 1-(1-p)^N,随 N 增大而迅速趋近于 1。OpenAI 在其关于 o1 模型的研究中已经证明,在许多任务上增加推理时计算(如多次采样后选优)比增加训练时计算更具性价比。
在 Agentic Engineering 的语境下,Best-of-N 被从 token 级别提升到了整个工作流级别——不是对单个回答多次采样,而是对整个软件开发流程多次独立执行,最后从多个完整的应用产物中挑选最优解。
作者只用一个 prompt——要求把一个名为 Inkwell 的写作应用重新设计为"安静的房间(Quiet Room)"风格,使其更简洁聚焦——然后同时启动了 五个独立的软件工厂,每个都运行在自己的 Agent 沙箱中,配置各不相同:
- Default(默认配置,Gemini Flash + GLM 5.2 + GPT Luna)
- Frontier(前沿模型配置)
- Deepest Seek(纯 DeepSeek V4 Flash 配置)
- Open Weights(纯开源权重模型)
- Top Speed(追求速度的快模型组合)

每个沙箱都拥有独立的 URL,作者可以分别观察软件工厂的执行过程和最终生成的应用。这种模式的价值在于:当你有一个好想法,或者有多个方向想尝试时,可以让它们并行跑起来,最后从中挑选最佳结果。 这种做法之所以可行,正是因为算力成本的持续下降和沙箱技术的成熟,使得并行运行多个完整开发流程的边际成本变得可以接受。
模型分层:从"选模型"到"组合算力"
作者提出了一个重要的思维转变:如果你还在纠结用哪个模型,那你已经落后了。 他将模型分为三个层级——State-of-the-art(顶尖)、Workhorse(主力)、Lightweight(轻量)。
其中他特别看好新发布的 DeepSeek V4 Flash(0731),称其"以其价格来说简直离谱"。DeepSeek 是一家以极低成本训练高性能模型而闻名的 AI 公司,其 V3 模型的训练成本据报道仅约 560 万美元,远低于同等性能的西方模型。V4 Flash 延续了这一路线,采用混合专家架构(Mixture of Experts, MoE),在推理时只激活部分参数,从而在保持高质量输出的同时大幅降低每 token 的计算成本。
在 Artificial Analysis(一个独立的 LLM 性能基准测试平台,从质量、速度、价格三个维度对模型进行综合评估)的成本基准中,DeepSeek V4 Flash 位于成本最低区间,速度也不错(约 110 tokens/s),已经从上一代的 B 级跃升到 A 级主力模型区间。作者称之为"股市崩盘级别的经济性",非常适合承担 90% 的日常工作。这种趋势印证了作者所说的"智能沿模型层级向下传递"——今天的顶尖能力在 6-12 个月后就会被廉价模型复制。
他的核心主张是:组合算力,而非选择算力(Combine compute, don't select compute)。 你需要的是一个模型栈,而不是单一模型。
实测结果与失败案例分析
整个工作流跑了约 45 分钟,结果颇有看点:
- Top Speed 配置最快完成,14 分钟跑完,消耗 200 万 tokens;
- Deepest Seek 以最低成本、较快速度完成了高质量的重设计;
- Open Weights 配置中的 Kimi K3 模型完全失败,无法输出正确的 JSON 格式;
- Frontier 配置中的 Opus 5 在规划阶段跑了 13 分钟,消耗大量 token。

作者坦言,正是因为存在失败的可能,Best-of-N 模式才如此重要——"blast radius(爆炸半径)为零,爆炸半径就是这个盒子"。即使某个配置崩溃,也不会影响其他沙箱或本地环境。
说个细节,所有 Pi 编程 Agent 都使用了 OpenRouter 预置密钥,并限额 50 美元,跑完后即销毁密钥。OpenRouter 是一个统一的 LLM API 网关,它将 OpenAI、Anthropic、Google、Meta、DeepSeek 等数十家模型提供商的 API 聚合在一个统一接口下,开发者只需一个 API key 就能动态切换不同模型,无需为每个提供商单独管理认证和计费。其预置密钥(provisioned keys)功能允许用户创建带有消费上限的临时密钥,用完即销毁——这对于在沙箱中运行不受信任的 Agent 代码时控制成本和安全风险至关重要。这种模型路由层的出现,反映了 AI 基础设施领域的一个重要趋势:模型正在商品化,真正的差异化竞争转向了编排、组合和工作流层面。
Agentic Engineering 与 Vibe Coding 的本质区别
贯穿全文,作者反复强调一个区别:这是 Agentic Engineering(智能体工程),不是 Vibe Coding(凭感觉编程)。
"Vibe coding 是不知道你的系统在做什么,也不去看。Agentic engineering 是把你的系统了解得如此透彻,以至于你不需要去看。"
"Vibe Coding"这个概念最早由 Andrej Karpathy 在 2025 年初提出,指的是开发者在不完全理解代码的情况下,通过与 AI 对话来"感觉着"编程。它降低了编程门槛,但也带来了系统不可控的风险。Agentic Engineering 则截然相反——它要求工程师对整个系统的行为有深刻理解,只是将执行环节委托给 Agent。两者表面看起来可能很像(都是人类不直接写代码),但 Agentic Engineer 是在"用系统思维思考"——他们考虑的是系统的第一百次、第一千次运行,考虑的是可观测性、可复用性、隔离与规模。作者警告工程师:不要把你的思考外包给 AI 实验室或第三方工具,要贴近工程本身。

他还给出了一个略显激进的判断:"如果你在用 Agent 直接修改应用层代码,你就是在浪费时间。" 少数例外是当你在"构建那个构建系统的系统"时——这种情况下确实需要亲自下场、来回 prompt、盯着 Agent 干活。这里的逻辑是:你应该花时间在元层面(meta-level)——构建和完善软件工厂本身,而不是在对象层面(object-level)——直接用 Agent 写业务代码。一旦工厂被构建好,它就能自动化地、可重复地生产高质量代码,这才是真正的杠杆所在。
走向算力充裕的时代
作者的最终落脚点,是为"算力充裕的时代(Age of Abundant Compute)"做准备。他观察到智能正在沿着模型层级向下传递——曾经顶尖的能力,如今正在变成廉价的主力模型。这一趋势背后有深层的经济和技术驱动力:一方面,开源模型(如 Llama、Qwen、DeepSeek)通过知识蒸馏和架构创新不断缩小与闭源前沿模型的差距;另一方面,推理芯片的竞争(NVIDIA、AMD、Google TPU、各类 AI ASIC 创业公司)正在压低每 FLOP 的成本。当推理成本低到一定程度,"用算力换质量"(即 Best-of-N、多 Agent 并行、大规模验证)就变成了经济上可行的策略。
他将工程师的角色比喻为一个函数:接收输入、执行、综合、交付输出。 而软件工厂加上 Agent 沙箱,正是放大这一函数杠杆的机制。
伟大的 Agentic Engineering 不在于全程盯着 loop,而在于在关键节点出现——规划、审查、prompting 和验证。你在 loop 里待得越久,你就越是瓶颈。
作者最后坦诚地表示,随着低层次的杠杆("人人都在用 Claude Code、人人都有终端 Agent")被榨干,下一阶段的杠杆需要真正的前期投入和工作。但对于愿意专注的工程师来说,这正是抢占先机的最佳时刻。当每个人都能使用相同的 AI 工具时,差异化将来自于你如何编排这些工具、如何设计工作流、如何构建可复用的软件工厂——这才是 Agentic Engineering 的核心竞争力。
核心要点
相关推荐

给Agent装上屏幕:DeepSeek可视化工作台开源实录
一位建筑行业开发者基于DeepSeek Harness开源了可视化工作台插件,实现从纯对话到图形化交互的升维。文章详解六个真实项目案例、完整创建流程及Agent时代的交互革命思考。

vLLM v0.29.0rc4发布:修复TRT-LLM推理同步瓶颈详解
深入解析vLLM v0.29.0rc4候选版本核心更新:修复TRT-LLM ragged prefill场景中的不必要GPU同步问题,消除CPU-GPU同步开销,提升推理吞吐与延迟表现,附生产部署建议。

OpenAI迁移至HTTPX:为何放弃requests库
深入分析OpenAI Python SDK从requests迁移至HTTPX的技术原因,包括异步双模式支持、HTTP/2多路复用等核心优势,以及对开发者生态的实际影响。