Daytona如何重新定义AI Agent计算沙箱基础设施

当AI Agent从概念走向大规模部署,一个被忽视的关键问题浮出水面:这些智能体到底需要什么样的计算环境?Daytona CEO Ivan Burazin在一次深度访谈中,揭示了AI Agent基础设施市场正在经历的剧变——74%的月环比增长、每天85万个沙箱的运行规模,以及一个可能比人类PC市场更大的全新赛道。
AI Agent基础设施的历史背景:AI Agent作为一种能够自主规划、执行多步骤任务的智能系统,其大规模部署需求在2023-2024年间随着大语言模型能力的跃升而急剧增长。早期的Agent框架(如LangChain、AutoGPT)主要在开发者本地环境或传统云VM上运行,但随着Devin、Cursor等代码Agent的商业化,以及Anthropic、OpenAI相继开放工具调用(Function Calling)和计算机操作能力,Agent对隔离、安全、高并发计算环境的需求开始超越传统基础设施的设计边界。计算沙箱(Sandbox)最初是安全领域的概念,指隔离运行不可信代码的受控环境。从早期的chroot jail、到虚拟机、再到容器技术,沙箱的隔离粒度与启动速度之间始终存在权衡。gVisor(Google)、Firecracker(AWS)等项目代表了将安全隔离与轻量化结合的最新尝试。AI Agent时代对沙箱提出了新的维度要求:不仅要快速启动、安全隔离,还需要支持有状态持久化、动态资源调整和大规模并发——这推动了以Daytona、E2B、Modal为代表的新一代Agent专用沙箱基础设施的兴起。
从浏览器IDE到AI沙箱:一次关键的战略转型
Daytona的故事要从2000年代初说起。Ivan和联合创始人最早做的是服务器虚拟化和路由器等基础设施服务,后来创建了全球最早的浏览器IDE之一——Code Anywhere。那时没有VS Code,没有Kubernetes,Docker还未公开发布,一切底层技术栈都需要自己搭建。
这段经历成为了Daytona日后的核心竞争力来源。三年前,团队开始将Code Anywhere的底层技术重新包装,为人类工程师提供自动化开发环境。但真正的转折点发生在2024年底。
当时,Ivan通过渠道提前接触到了Devin(当时尚未公开),团队尝试将开源版本OpenDevin(现更名为OpenHands)与自家基础设施结合,推出SaaS服务。虽然直接用户不多,但大量正在构建AI Agent的团队主动找上门来:"我的Agent需要一个计算沙箱运行时。"这个信号让团队意识到,一个全新的市场正在形成。

为什么Agent不能用人类的基础设施
最初,很多人质疑:"为什么Agent需要专门的基础设施?EC2、VM不够用吗?"Ivan的团队在早期也犯了这个错误——他们把为人类设计的开发环境直接给Agent用,结果20-30个早期用户全部反馈"这不是我们需要的"。
经过深入研究,团队总结出Agent计算环境的三个核心需求:
极致速度:Agent需要毫秒级的环境启动时间。Daytona目前单个沙箱的启动时间为60毫秒(含网络延迟),同时启动5万个沙箱约需75秒,而某些竞品需要2000秒(约30分钟)。
有状态持久化:就像人类不希望笔记本电脑在工作中途被关机一样,Agent也需要"合上盖子、打开继续"的能力。沙箱需要支持暂停和恢复,保持完整状态。
动态可组合:不同任务需要不同的计算资源组合。Agent可能需要动态调整CPU、内存、磁盘,甚至添加GPU。Daytona支持运行时动态扩容,几乎不会出现OOM(内存溢出)问题。
关于OOM(内存溢出):OOM是指进程申请的内存超过系统可用内存时触发的错误。Linux内核的OOM Killer机制会在内存耗尽时强制终止进程,这对长时间运行的AI Agent任务是灾难性的——可能导致数小时的工作成果瞬间丢失。传统容器编排系统(如Kubernetes)通过预设资源限制(Resource Limits)来防止OOM,但这要求提前准确预估内存需求,而AI Agent的内存消耗往往难以预测(取决于任务复杂度、上下文长度等动态因素)。Daytona的动态扩容能力意味着沙箱可以在运行时按需申请更多内存,而非被静态配额硬性限制,这对需要处理大型代码库或复杂推理任务的Agent尤为关键。
用Ivan的话说,Daytona本质上是"Lambda和EC2的结合体"——既有Lambda的速度,又有EC2的持久性。

裸金属架构:速度优势的技术根基
与大多数竞品在VM上运行Firecracker不同,Daytona从一开始就选择了裸金属(bare metal)架构。团队自研了调度器,直接使用底层机器的磁盘、CPU和内存。
裸金属与虚拟化架构的本质差异:裸金属(Bare Metal)服务器是指用户直接使用物理服务器硬件,无需经过虚拟化层。相比之下,传统云计算(如AWS EC2)在物理机上运行Hypervisor,再在其上创建虚拟机,每一层抽象都会引入延迟和性能损耗。Firecracker是AWS开源的轻量级虚拟机监控程序(VMM),专为无服务器计算设计,能在125毫秒内启动微型VM,被广泛用于AWS Lambda和Fargate——这已经是业界领先水平,但仍比裸金属方案慢一个数量级。NVMe(Non-Volatile Memory Express)是专为固态硬盘设计的高速存储协议,相比传统SATA接口,IOPS可提升数十倍。EBS(Elastic Block Store)是AWS的网络附加存储,虽然灵活,但网络传输本身会引入毫秒级延迟。Daytona选择裸金属+本地NVMe的组合,正是为了将这些中间层延迟压缩到极限。
这种架构带来了几个关键优势:
- IOPS极快:没有EBS等网络存储的延迟,所有I/O操作都在本地NVMe驱动器上完成
- 快照预加载:模板和快照预先加载在裸金属机器上,启动沙箱时直接定位到对应的物理机器
- 零网络延迟:沙箱内部操作完全在本地完成
有趣的是,当第三位联合创始人看到这个架构时,他的反应是:"这不是2008年的东西吗?"CTO回答:"没错。"有时候,最先进的解决方案恰恰来自对基础原理的回归。
隔离层面,Daytona默认使用Docker容器配合Sysbox加固,安全性等同于VM但保持了容器的轻量特性。
Sysbox容器运行时的技术细节:Sysbox是由Nestybox(已被Docker收购)开发的开源容器运行时,其核心创新在于通过用户命名空间(User Namespace)隔离和内核特性模拟,使Docker容器能够运行完整的Linux系统栈(包括systemd、Docker daemon、Kubernetes等),同时不需要特权模式(privileged mode)。传统特权容器虽然功能强大,但与宿主机共享内核命名空间,存在严重的安全风险;而Sysbox通过在容器内虚拟化/proc、/sys等系统接口,实现了接近VM的隔离级别,同时保持了容器的毫秒级启动优势。这对AI Agent场景尤为重要——Agent往往需要在沙箱内执行任意代码、运行Docker容器甚至完整的开发环境,Sysbox提供了安全与灵活性的最佳平衡点。
同时支持Docker-in-Docker,用户可以在沙箱内运行Docker Compose甚至K3s集群,这大幅扩展了可支持的工作负载类型。
两种截然不同的工作负载模式
Daytona目前服务两大类工作负载,它们的使用模式截然不同:
后台长运行Agent
这类客户包括Cognition(Devin)、Lovable、Harvey等。它们的使用模式类似人类——"跟着太阳走",中午最高、午夜最低、周末下降。这类负载相对可预测,可以通过跨地域调度来优化利用率。
RL训练与评估
这是增长最快的工作负载类型。几个月前RL工作负载占比为零,到访谈时已接近50%。这类负载的特点是极度"尖峰化"——要么什么都不用,要么突然需要10万个CPU,用完后又归零。
强化学习训练的计算特性:强化学习(Reinforcement Learning,RL)是机器学习的一个分支,智能体通过与环境交互、获取奖励信号来优化策略。在大语言模型领域,RLHF(基于人类反馈的强化学习)是目前主流大语言模型对齐的核心技术,由OpenAI在InstructGPT论文中系统化提出,其训练流程包括监督微调(SFT)、奖励模型训练和PPO策略优化三个阶段。近期,DeepSeek-R1等模型采用的GRPO(Group Relative Policy Optimization)算法进一步简化了流程,但对并行环境采样的需求更为极端。RL训练的计算特性极为特殊:训练阶段需要同时运行数千至数万个并行环境(rollout workers)来采集经验数据,这些环境在训练批次结束后立即销毁,形成极端的"全有或全无"资源需求模式。这与Web服务的平滑流量曲线截然不同,对基础设施的弹性伸缩能力提出了前所未有的挑战——传统云平台的自动扩缩容往往需要数分钟,远不能满足RL训练的秒级需求。
这种尖峰模式给基础设施带来了前所未有的挑战。Daytona当前的平均利用率仅15%,但峰值可达90%。Ivan在自己举办的Compute Conference上发现,这个问题是整个Agent基础设施行业的共性挑战——无论是Neon(数据库)、Parallel(搜索)还是其他提供商,都面临同样的困境。

Computer Use:下一个万亿级市场
Ivan认为,Computer Use(计算机操作)可能是Agent最重要的"杀手级应用"。
Computer Use技术原理与RPA对比:机器人流程自动化(RPA)是Computer Use的前身技术,代表厂商包括UiPath、Automation Anywhere和Blue Prism。传统RPA通过识别UI元素的固定属性(如按钮ID、XPath路径)来录制和回放操作,脆弱性极高——界面稍有变动即可导致自动化流程崩溃,维护成本居高不下。Computer Use的根本突破在于引入了视觉理解能力:模型通过截图理解当前界面语义,动态决策下一步操作,无需预先定义UI元素映射。Anthropic于2024年10月率先在Claude 3.5 Sonnet中发布了这一功能,标志着AI从纯文本交互向图形界面操控的重大跨越。与RPA不同,Computer Use不依赖预定义的UI元素选择器,而是通过视觉理解动态适应界面变化,理论上可以操作任何有屏幕的软件。Headless方案(无界面浏览器/API调用)虽然效率更高,但受限于企业遗留系统的封闭性——大量关键业务数据仍锁定在无API的桌面应用中,Computer Use是目前唯一可行的自动化路径。然而,Computer Use对基础设施提出了独特挑战:需要运行完整的图形化操作系统,渲染虚拟显示器,处理截图传输的带宽开销,以及管理GUI应用的状态持久化——这些需求远超传统无头浏览器自动化的基础设施假设。
他给出了一组惊人的数据:
- 美国约有1亿知识工作者,全球约10亿
- 美国知识工作者薪资总额约10万亿美元,全球约50万亿
- 其中56%集中在医疗、政府、金融等五大行业
- 大量工作仍锁定在Windows上的遗留应用中
即使按照RPA市场25%的自动化率保守估计,如果Agent能达到40%的自动化率,这就是一个10万亿美元规模的市场。
Ivan用自己的亲身经历说明了这一点:他在制作董事会报告时,尽管使用了Claude Code连接ClickHouse、PostHog、QuickBooks等现代工具,仍然有大量数据无法通过API获取。最终他在Mac Mini虚拟沙箱中部署了OpenClaw,给它创建了公司各系统的只读账户,让Agent直接登录网站、导出数据、完成报告。
"如果连我们这样的创业公司,用着最新的工具,仍然需要Computer Use Agent,那高盛怎么可能用纯headless方案解决问题?"
Daytona目前已支持Windows沙箱(秒级启动,支持快照和分叉),Mac OS沙箱也在开发中,但受限于苹果的许可协议——每台机器只允许运行2个并行VM,且每24小时才能更换一次用户授权。
市场格局与增长逻辑
全球化的意外发现
Daytona的用户分布呈现出一些有趣的特征:按用户数量计,新加坡是第一大城市(而非硅谷),东京也异常活跃——这在以往的技术周期中从未出现过。巴西则延续了其在开发者生态中的传统强势地位。
开源策略的务实选择
Daytona采用AGPL-3.0许可证,这是一种介于完全开源和商业许可之间的务实选择。
AGPL许可证的战略含义:AGPL-3.0(GNU Affero通用公共许可证)是GPL的网络服务扩展版本,其核心条款要求:任何通过网络提供服务的修改版本,必须向用户开放源代码。这一条款使其成为云服务商的"天然屏障"——AWS、Google Cloud等大型云厂商若想将AGPL项目作为托管服务销售,必须开放其所有修改,这在商业上几乎不可接受。因此,AGPL既保持了开源社区的透明度和贡献激励,又防止了大型云厂商的"免费搭车"。MongoDB、Grafana等知名开源项目均采用过类似策略。对Daytona而言,开源代码库还有一个AI时代的特殊价值:用户可以将代码仓库直接提供给AI Agent,让其获得完整的集成上下文,降低接入门槛。
Ivan坦言,开源对云产品的消费增长帮助更大,而非直接转化自托管用户——因为用户可以把代码仓库发给Agent,让它获得更多集成上下文。

25人团队的极致响应力
Daytona目前仅25人,但维护着约1000个Slack Connect频道。在客户案例调研中,"极致的响应速度"被反复提及为选择Daytona的首要原因。团队中13人与创始人有7年以上的合作历史,这种高信任、高默契的团队文化是其服务质量的根基。
对SaaS行业的冷思考
Ivan提出了一个颇具争议的观点:市场正在错误地为"转售Token"的SaaS公司赋予溢价。他认为,所谓的"收入再加速"本质上是低毛利的Token转售收入,与传统SaaS的高毛利订阅收入完全不同。
他的建议是:SaaS公司应该把所有产品功能通过API暴露出来,按消费量收费,而不是在中间加一层Agent来转售Token。Salesforce的Marc Benioff最近宣布将所有产品通过API开放,Ivan认为这才是正确方向。
"数据仍然是孤岛化的。你给我一个Agent,数据还是孤岛。不如直接把数据暴露给我的Agent。"
未来展望:Agent的专属云
整个Agent基础设施市场正以每月40%以上的速度增长。Ivan认为,未来将出现一个专门为Agent构建的云平台——包含沙箱、网络搜索、数据库等所有Agent所需的基础设施原语。而且,"我们还没有看到所有的基础设施原语,还有更多正在被发明出来。"
从CPU供应的角度看,这个市场甚至可能面临与GPU类似的短缺问题。Semi Analysis的分析师Dylan Patel在Compute Conference上指出,CPU正在成为新的瓶颈——当每个Agent都需要一台"计算机"时,80亿人口的PC市场规模可能只是Agent计算市场的起点。
CPU短缺与Agent计算经济学:GPU短缺在2023-2024年间成为AI行业的标志性瓶颈,NVIDIA H100/H200的供不应求推动了大量算力基础设施投资。然而,Agent大规模部署带来的是一种截然不同的算力需求结构:推理阶段(Agent执行任务)主要消耗CPU和内存,而非GPU算力;每个Agent实例需要独立的隔离环境,意味着CPU核心数、内存容量和存储IOPS成为新的瓶颈维度。GPU短缺的本质是AI训练对并行浮点运算的极端需求,而Agent大规模部署带来的是对通用计算(CPU)、内存和存储的海量需求——这是一种截然不同但同样巨大的算力压力。从经济学角度看,Agent计算的单位经济模型也与GPU训练不同——训练是高度集中的批处理任务,而Agent执行是高度分散的长尾任务,对基础设施的调度效率和资源利用率提出了更高要求。Semi Analysis等机构的分析表明,随着Agent渗透率提升,x86服务器的采购需求可能在未来3-5年内出现结构性增长,形成类似GPU短缺的供需错配。
正如Ivan所说:"人类有80亿,每人大约需要1-2台电脑。但两年后、十年后、一百年后,会有多少Agent在运行?每一个任务都需要一个沙箱。这个市场本质上是无限的。"
相关推荐

特朗普手机悄然涨价250美元,T1 Phone定价升至749美元
Trump Mobile旗舰T1 Phone从499美元悄然涨至749美元,涨幅达250美元,硬件配置未做任何升级。深入分析特朗普手机静默涨价背后的供应链压力、品牌定价策略及市场竞争困境。

DeepSeek V4-1 Flash发布:552B参数MoE多模态模型支持百万上下文
DeepSeek发布V4-1 Flash多模态大模型,采用552B参数混合专家架构(MoE),支持100万tokens超长上下文窗口。深入解析其MoE架构、多模态能力、成本优势及对AI行业的影响。

沃尔沃XC40插混版回归:传感器升级+Gemini AI加持
沃尔沃XC40 PHEV插电式混动版时隔三年重返市场,带来全新外观设计、升级传感器套件及谷歌Gemini AI车机系统。了解这款车型的核心升级亮点、插混回归的市场逻辑及生成式AI进入座舱的深远意义。