L8首席工程师实战:AI Agent从零到上线全流程拆解

资深工程师借助多Agent编排框架,从零构建可上线iOS零花钱应用,全程几乎不亲手写代码。
本文记录了一位前Meta/微软/Atlassian工程师「坤」的完整演示:借助自研的多Agent框架FirstMate,以「船长-大副」协作模式,从空终端出发,在几乎不亲自编写代码的情况下,构建了一款面向儿童的零花钱管理iOS应用。整个流程涵盖市场调研、交互原型、设计系统、后端搭建、基础设施配置和端到端测试,并在安全(Atomic Vault密钥管理)、治理(PR工作流、无错误模式)和成本控制(Hetzner VPS替代托管方案)等方面展示了生产级工程判断。演示同时证明,使用中等效能的模型(Luna、Sonnet)而非最强模型,同样能交付真正可上线的全栈产品。
前言:一次真实的AI Agent全栈开发演示
曾任职于Meta、微软和Atlassian的L8高级首席工程师「坤」,此前发布的自主工程工作流视频获得了60万次播放。应观众请求,他这次完整演示了如何借助AI Agent工作流,从一个空终端开始,构建一个可真正上线的iOS应用。
这个项目源于一个真实需求:他的儿子Eddie需要一款管理零花钱的应用。这个应用不仅要跟踪虚拟余额,还要具备教育价值——帮助孩子理解余额、贷款、信用额度、利息等基础金融概念,并且区分「家长模式」和「儿童模式」,数据需要存储在云端以支持多设备同步。
整个过程最引人注目的一点是:开发者几乎没有亲自编写代码,甚至没有仔细审查大部分代码,而是通过与一个AI Agent「大副」持续对话来推进整个项目。
核心方法论:船长与大副的协作模式
作者使用了自己开发的开源项目 FirstMate,其核心理念是构建一个「船长-大副」的层级式Agent协作系统。开发者扮演「船长」,只需与一个名为「大副」的Agent沟通,由大副负责将任务拆解并委派给不同的「船员」Agent并行执行。
这种设计的关键价值在于大幅降低认知负担。作者反复强调,他不需要在多个任务之间频繁切换,也不需要自己去协调「哪个Agent需要引导、哪个不需要」。大副会自动处理所有复杂的任务编排。
有意思的是,作者选择了「平静模式」(Calm Mode),隐藏了所有工具调用的噪音,终端上只显示他的提示和FirstMate的回复。他的观点是:"对于一两年前那些不够智能的模型,查看Agent正在做什么很有用,因为它们经常走错路径。但现在的模型,我越来越不需要引导智能体了。"
不追求最强模型
一个反直觉的选择是:作者刻意没有使用最强的GPT-5.6 High模型,而是选用了更高效的「Luna」模型(GPT-5.6 Luna X High)。他想证明的是:你并不总是需要最好的模型来完成每件事,从更高效的模型中同样能获得大量价值。
事实证明,在整个项目中,Luna唯一一次给出让他不认同的建议是在VPS成本决策上——推荐了托管的Supabase方案,被作者认为对MVP阶段过于昂贵。除此之外,Luna的表现相当出色。
FirstMate 代表的是「多 Agent 编排」范式的一种具体实现。与单 Agent 逐步执行任务不同,编排框架允许一个「协调者」Agent 将整体目标拆解为子任务,并将这些子任务分发给多个并行运行的「执行者」Agent。这种架构的核心优势是吞吐量:原本需要串行等待的调研、设计、开发步骤可以同时推进,总耗时大幅缩短。这类框架在工程上需要解决几个关键问题:子任务的上下文隔离(每个 Agent 只看到自己需要的信息)、结果的聚合与冲突解决、以及对外部工具调用的统一权限管理。OpenAI 的 Swarm、微软的 AutoGen、LangGraph 等都是解决类似问题的开源方案,FirstMate 则是本文作者针对工程开发场景的自定义实现。
从需求到原型:市场调研先行
项目启动时,作者向大副输入了一段约3000字符的"唠叨"——把脑海中所有关于需求、想法、思路的内容一股脑说出来。这正是他开始新项目的典型方式。
他要求大副同时并行处理两件事:
- 市场调研:确认是否已有能满足这些功能的现成应用。如果有,直接安装即可;如果没有,就是一个值得填补的独特缺口。
- 技术调研:如何端到端地构建这个完整技术栈。
大副随即开出了两个并行的"侦察兵"标签页分别处理。随后作者进一步要求生成可实际交互的HTML原型(而非仅停留在Markdown文档的范围定义),聚焦于线框图、屏幕概念和用户流程,而非精修的UI。

通过实际操作HTML原型,作者发现了不少细节问题并给出反馈:比如货币单位应默认为本地货币(美元),最近活动列表出现重复入口,儿童申请积分的流程等。这些反馈最终被整理成一份PRD(产品需求文档)写入仓库。
设计系统:用Cloud Design构建一致性
在产品需求明确后,作者转向使用云设计工具。他特别强调创建的是设计系统而非单个设计——一旦设计系统建立,后续构建更多UI组件、屏幕时就无需重新发明每个元素,并能保证一致性。

有趣的是,设计阶段作者原本想用更强的模型,但基于节俭原则选用了Sonnet。设计系统涵盖了品牌色(儿子喜欢的金色)、图标、卡片设计等。作者对初版设计给出的核心反馈是:"整体感觉不像一款儿童应用",要求做得更有趣、友好、适合孩子。
最终应用图标从存钱罐比喻演化为放大的小猪形象,并生成了符合iOS格式要求的图标缩略图。
安全实践:Atomic Vault管理密钥
在搭建后端时,作者展示了一个关键的安全实践——使用 Atomic Vault(由Homebrew创始人Max Howell创建的开源项目)来管理密钥。
每当Agent需要访问Hetzner API令牌、Cloudflare API密钥等生产环境密钥时,会触发一个授权对话框,让作者审查并决定是否批准。令牌以环境变量形式传递,Agent根本看不到明文。
作者对此的洞察颇具前瞻性:"随着我们越来越多地将事情交给Agent,这将变得越来越重要。否则如果你把密钥都放在ENV文件里,你真的不知道Agent什么时候已经把它们泄露出去了——也许它已经把密钥作为公共API调用的一部分发布到了别处。"
Agent 的密钥安全问题在业界被称为「凭证泄露」(credential exfiltration)风险,是 AI Agent 走向生产环境面临的核心安全挑战之一。传统做法是将密钥写入 .env 文件,Agent 在运行时直接读取环境变量。这种方式的问题在于:Agent 在整个会话中持有明文凭证,一旦提示词被注入恶意指令(prompt injection),或 Agent 误将密钥写入日志、提交到代码仓库,泄露就会发生。Atomic Vault 的解法类似于操作系统的「最小权限原则」——密钥在需要时才短暂暴露给调用进程,Agent 本身无法持久访问明文。OWASP 的 LLM Top 10 威胁清单中,「不安全的插件设计」和「过度授权」均指向这类风险,说明密钥的即时授权管理已成为 AI 安全规范的重要组成部分。
技术栈决策:成本与声明式基础设施
在基础设施选择上,作者体现了资深工程师的判断力。他否决了托管Supabase方案,选择了低成本的Hetzner VPS,费用远低于30-60美元/月的预期。

他还要求将基础设施改用 OpenTofu(Terraform的开源替代)以代码形式管理——机器和所需资源都声明在一个可审计、可提交、可进行源码管理的文件中。
在部署环境上,作者纠正了GPT-5.6模型「过度设计」的倾向。模型原本想部署开发和生产两套环境,但作者判断对于一个全新的、没人使用的应用,"真的没有必要设置不同的环境层级",只需一个生产环境即可。他坦言:"这些就是我们人类仍然需要做出一些判断的地方。"
OpenTofu 是 Terraform 的社区分叉版本,诞生于 2023 年 HashiCorp 将 Terraform 改为非开源许可证(BSL)之后,由 Linux 基金会托管,保持与 Terraform 的语法兼容。「基础设施即代码」(Infrastructure as Code,IaC)的核心价值在于将服务器、网络、DNS 等资源的配置以声明式文件形式管理:你描述「期望状态」,工具负责计算并执行从「当前状态」到「期望状态」的变更步骤。这对 AI Agent 工作流尤其重要——Agent 可以直接修改 .tf 文件并执行 tofu apply,整个基础设施变更过程留有版本记录、可审查、可回滚,避免了 Agent 通过命令行直接操作云资源时「做了什么、改了什么」难以追溯的问题。
工作流治理:无错误模式与压缩
项目采用了从「直接推送」到「基于PR」的工作流演进。作者提出了一个实用的判断标准——何时开启无错误模式(No Faults Mode):
"如果这是一次会有其他人帮你人工审查的代码更改,你就应该开启无错误模式;如果你是独立完成、不希望有人审查,那就应该开启这个功能(建立本地验证流程)。"因为在原型阶段代码尚未成型,他暂不开启;一旦达到MVP,则切换到更严格的审批流程。
关于上下文压缩,作者分享了重要经验。GPT模型默认272k的上下文窗口相对较短,达到约80%会自动触发压缩。他推荐使用 openai-server-compaction 插件——让PI Agent在运行GPT模型时调用OpenAI的服务器端压缩,对长时间运行任务效果最佳。整个项目经历了四次自动压缩,但性能几乎没有明显下降。作者的结论是:"压缩现在真的已经成为一个大多数人都不需要再担心的实现细节了。"
上下文压缩(context compaction)是大语言模型在长任务中保持连贯性的关键机制。模型的上下文窗口(context window)是其单次能处理的 token 总量上限——GPT 系列约为 128k 至 272k token。当一个编码任务涉及大量文件读写、多轮对话和工具调用记录时,上下文很容易接近上限。压缩的核心思路是用一个摘要替换历史对话中不再需要精确引用的部分,从而释放 token 空间。服务端压缩(如 openai-server-compaction)相比客户端截断的优势在于:压缩逻辑由模型提供商优化,能更智能地保留关键代码片段、决策背景和当前任务状态,而不是机械地丢弃最早的消息。压缩质量直接影响 Agent 在长时间任务后是否还能「记住」早期的架构决策和用户偏好。
端到端测试与MVP交付
在临近完成时,作者拒绝接受Agent「一切正常」的口头汇报,坚持要求真实证据。他明确指示:"除非有只有我才能处理的事情,否则不要问我,你应该尝试做端到端测试,看看能不能找出真正的错误。"

最终的MVP验收标准清晰明确:在iOS模拟器中用真实Apple账户登录,连接部署在VPS上的真实后端(通过Cloudflare配置的子域名 ediswallet.conchaingate.com 并启用HTTPS)。
测试成功:登录奏效后,家长模式添加10美元,儿童视图同步显示10美元;登出后用另一账户重新登录,云端数据被正确获取。整个全栈流程端到端跑通。作者计划将应用上传到TestFlight,第二天就能在儿子的iPad上真正使用。
总结:AI Agent工程学的成熟信号
这次演示传递出几个值得关注的信号:
第一,AI Agent的自主性已达到实用级别。开发者的角色从「编码者」和「引导者」转变为「决策者」和「审查者」,主要工作是提供需求、做关键判断、把控质量门槛。
第二,多Agent并行编排成为效率关键。通过大副的任务委派机制,市场调研、技术调研、前后端开发、基础设施配置得以并行推进。
第三,安全与治理机制正变得不可或缺。密钥的授权管理、无错误模式、PR工作流等,都是将生产级Agent工作流付诸实践的必要护栏。
正如作者所言,即便没有使用最强的模型(云设计用了Sonnet而非Opus,主流程用了Luna),依然完成了一个真正可上线的全栈应用。这或许正是AI辅助开发走向成熟的最好证明。
相关推荐

Arm Mali G2-Ultra NX深度解析:AI原生图形如何实现移动桌面级GPU性能
深度解析Arm Mali G2-Ultra NX GPU的AI原生图形架构,探讨其如何将桌面级游戏性能带入移动平台,涵盖神经渲染、超分辨率重建等关键技术及对移动游戏生态的深远影响。

RAG做不好GTM智能体的原因:从信息检索到专家推理的跃迁
单靠RAG检索增强生成无法构建高效的GTM智能体。本文深入分析GTM知识的特殊性——模式识别而非事实检索,并探讨如何将操作者经验知识转化为可推理的智能体能力,实现从信息检索到专家推理的跃迁。

48小时150美元造SaaS:为智能体而非人构建的新范式
一位SaaS创作者用Grok 4.6在48小时内、150美元Token成本从零构建完整SaaS产品。深度解析其技术选型、产品决策与核心方法论——为什么未来的SaaS应该为AI智能体而非人类用户构建。