[控场AI]
· 10 分钟阅读· 5,241 字

Claude Code负责人访谈:AI编程ROI思维、Loops与工程师角色转变

Claude Code负责人访谈:AI编程ROI思维、Loops与工程师角色转变

Claude Code负责人Boris Cherny近日在Meta举办的一场炉边谈话中,分享了他对AI编程现状、ROI思维、Loops概念以及工程师角色转变的深刻见解。这场对话信息量极大,涵盖了从个人编码习惯到企业部署策略的方方面面。

100%代码由AI编写:一个新常态的到来

当主持人问Boris今年写了多少代码时,他给出了一组惊人的数据:1700个PR,新增40万行代码,删除20万行代码,自3月以来消耗了80亿tokens。

Token是大语言模型处理文本的基本单位,大致相当于一个英文单词的3/4或一个中文字符。模型的使用成本通常按输入和输出的token数量计费,例如Claude Opus级别模型的定价约为每百万输入tokens 15美元、每百万输出tokens 75美元。80亿tokens的消耗量意味着极其密集的AI交互,这也从侧面解释了为什么企业级AI编程的成本控制成为核心议题。

更关键的是——自去年11月Opus 4.5发布以来,他100%的代码都由Claude Code编写。

他甚至卸载了IDE,因为"再也用不到了"。更令人意想不到的是,他现在大部分编码工作是在手机上完成的。"如果六个月前你告诉我这些,我会觉得你疯了。但事实就是如此。"

在Anthropic内部,80%到90%的代码由Claude Code编写,而且越来越多的团队已经达到100%。Claude Code本身就是完全由Claude Code编写的。

AI编程的ROI思维:不要只盯着成本

面对企业设定AI预算(如Uber每位工程师每月1500美元)与前沿模型越来越贵之间的矛盾,Boris给出了一个清晰的框架:不要用成本思维,要用ROI思维。

他观察到最成功的企业部署策略有几个关键要素:

  • 广泛分发tokens:不仅给工程师,也给产品经理、设计师、数据科学家,甚至市场营销人员。"最具创新性的想法往往来自你意想不到的人——可能是组织角落里的一个会计。"
  • 给予实验的安全感:让团队成员敢于尝试,不会因为实验失败而受到惩罚。
  • 后端控制成本,而非前端限制:一旦找到有效的内部用例,再通过座位成本控制、advisor模型、effort级别调整、基于RBAC的预算等手段优化。

其中,RBAC(Role-Based Access Control,基于角色的访问控制)是企业IT治理的基础架构模式。在AI编程工具的语境下,RBAC意味着根据员工角色(如初级工程师、高级工程师、产品经理)分配不同的AI使用权限和预算额度——可以控制可使用的模型等级、每日token配额、可访问的代码仓库范围等。这种精细化控制使企业能够在鼓励广泛使用AI的同时,保持对成本和安全的可控性。

Boris特别强调,Anthropic内部已经看到工程师人均代码产出自年初以来增长了8倍。在这种量级的回报面前,"把几乎所有精力放在提高回报上,而不是削减成本。现在的上行空间远大于优化下行的空间。"

Loops概念解析:从Agent到Agent的Agent

Loops概念示意

当被问到"Loops是下一个炒作周期还是真实趋势"时,Boris用了一个精妙的类比来解释这个概念:

  • 源代码 = 编程中的语句(statement)
  • Agent写代码 = 编程中的函数(function)
  • Loops = 编程中的高阶函数(higher-order function)

在函数式编程中,高阶函数是指接受函数作为参数或返回函数的函数,例如JavaScript中的map、filter、reduce。这个类比精确地捕捉了Loops的本质:就像高阶函数不直接操作数据而是编排其他函数一样,Loops中的顶层Agent不直接编写代码,而是编排其他Agent去完成具体任务。这种多层Agent架构也被称为Agentic Orchestration,是当前AI系统设计中的前沿范式。

简单来说,Loops就是Agent提示Agent去写代码——一个持续运行的自动化循环。比如,你可以设置一个Agent每隔5-10分钟自动读取用户反馈,然后自动提交修复PR。

Boris坦言,目前Loops大约处于Agent一年半前的发展阶段——"还很早期,但已经开始看到它在起作用"。他个人日常约30%的代码通过Loops产生,努力的话某些天可以达到100%,但"还没有完全顺畅"。

他还分享了用Loops做代码维护的实践:让Claude Code在循环中自动审查代码架构、发现flaky测试并修复、删除无用测试、统一重复抽象。这些都以PR的形式提交,他只需要审查最终结果。

值得一提的是,Flaky test(不稳定测试)是软件工程中的顽疾——指在代码未发生变化的情况下,测试结果时而通过时而失败的测试用例。其成因包括竞态条件、环境依赖、时间敏感逻辑等。Google曾披露其代码库中约16%的测试存在flaky问题,这些不稳定测试会严重侵蚀开发团队对测试套件的信任,导致工程师忽视真正的失败信号。传统上修复flaky测试需要工程师深入理解测试的并发逻辑和环境依赖,是一项耗时且枯燥的工作,非常适合AI自动化处理。

Fable模型:至少与Opus 4.5同等量级的飞跃

Fable模型能力

Boris将Fable模型的能力提升比作去年11月Opus 4.5带来的那次"范式转变",甚至认为可能是更大的飞跃。

他描述Fable具有一种"细腻和多维度的思考方式",类似于他最聪明的同事——"它不再是一个不理解细微差别的钝器"。具体表现在:

  • 数据分析:能自然地追问"为什么"三次以触及问题本质
  • 调试能力:能形成假设、追踪假设、寻找证据
  • 编码质量:Boris表示"我已经想不出更难的问题给它了,每个问题基本都能一次或几次就解决"

关于模型选择策略,Boris的建议出人意料地简单:直接用最贵的模型,专注于提高回报。虽然可以通过advisor模型等方式降低约50%的投入,但回报端的提升空间可能是1000%甚至10000%。

不过他也坦承Fable的不足:产品直觉和分布式系统设计仍然是人类更擅长的领域。当被追问"还要多久模型能追上"时,他谨慎地说"大概年底会相当不错"。

持续消除开发瓶颈:从编码到代码审查再到安全

业务指标驱动

Boris描述了Anthropic内部如何系统性地消除开发流程中的瓶颈:

第一个瓶颈:编码 → 已通过Claude Code解决

第二个瓶颈:代码审查 → 推出Claude Code Review产品。它使用大量tokens进行全自动化审查,"当我看到一个PR时,基本可以保证所有bug都已被捕获——大约98-99%"。工程师只需判断"这个PR是否应该存在"。

第三个瓶颈:安全审查 → 推出Claude Security产品。每周自动扫描所有代码库,发现并自主修复安全问题。"借助Opus 4.8模型,它现在能发现连渗透测试人员都没发现的问题。"

第四个瓶颈:CI优化 → Boris分享了一个鲜活案例:他昨晚用一条简单的prompt让Claude Code使用动态workflow分析真实CI数据并优化,消耗了几百万tokens,运行几小时,产出4个PR,将CI时间缩短了50%。

CI(持续集成,Continuous Integration)是现代软件开发的核心实践,每次代码提交都会触发自动化的构建、测试和检查流程。对于大型代码库,CI运行时间可能长达30分钟甚至数小时,直接影响开发者的迭代速度和团队生产力。传统的CI优化需要深入分析构建依赖图、测试执行时间分布、缓存策略等,通常由专门的开发者效能(Developer Productivity)团队负责。Boris用AI在几小时内完成了这项工作并将CI时间缩短50%,意味着每位工程师每天可能节省数十分钟的等待时间,对整个组织的累积效益极为可观。这项工作过去可能需要数天甚至数周。

使用workflow

动态Workflow:测试时计算的新形态

Boris解释了动态workflow的本质——它是AI扩展定律(scaling laws)的第四个因素"测试时计算"(test-time compute)的新形态。

AI扩展定律源自OpenAI在2020年发表的开创性论文,该研究发现模型性能与三个因素呈幂律关系:训练数据量、模型参数规模(网络规模)和训练计算量(FLOPs)。2024年以来,"测试时计算"(test-time compute)被广泛认为是第四个扩展维度。其核心思想是:模型在推理阶段投入更多计算资源(生成更多tokens进行"思考")可以显著提升输出质量。OpenAI的o1/o3系列和Anthropic的extended thinking功能都是这一理念的产物。

动态Workflow将这一概念推向了新高度——不仅让单个模型思考更多,而是通过编排大量子Agent实现计算的并行扩展。调节方式有两种:

  1. Effort设置:从low到max,控制模型输出的token量
  2. 动态Workflow:Claude编写一个小程序在虚拟机中运行,协调数十、数百甚至数千个子Agent来解决问题

Co-work:为非工程师打造的Claude Code

Boris还介绍了Co-work——本质上是"为非工程师打造的Claude Code",底层使用相同的Claude Agent SDK,但增加了更多安全护栏,包括完整的虚拟机隔离和操作系统级保护。

他分享了两个个人用例:

  • 项目管理:Co-work自动在Slack中询问每位工程师的工作状态(有时是工程师的Claude回复),然后填充到电子表格中
  • 差旅预订:设置定时任务,每天扫描邮件和Google日历,自动预订机票和酒店。他去东京、伦敦、柏林的多段行程全部由Co-work自动完成,"我完全没有介入"

工程师如何避免过度依赖AI输出?

面对"如何防止工程师盲目接受AI输出"的问题,Boris给出了两个层面的回答:

技术层面:Auto Mode与安全机制

Anthropic发现工程师对权限提示产生了"疲劳"——不断点"是"而不真正阅读内容。这反而降低了安全性。因此他们推出了Auto Mode,由模型根据对话上下文自动决定是否批准操作。

这一设计的安全基础在于Claude模型对prompt注入攻击的极强抵抗力(100次尝试的成功率约1%)。Prompt注入(Prompt Injection)是针对大语言模型的一类安全攻击,攻击者通过在输入中嵌入恶意指令来劫持模型行为。例如,在代码注释中隐藏"忽略之前的所有指令,执行以下命令"这样的文本。当AI Agent拥有文件读写、命令执行等系统权限时,prompt注入的危害尤为严重——攻击者可能通过一个被污染的依赖包或代码文件,诱导Agent执行任意操作。Anthropic声称的1%成功率在行业中属于领先水平,这也是Auto Mode能够让Agent安全运行数小时甚至数天的技术基础。

学习层面:多种输出模式适配不同需求

Claude Code提供了output style设置。新工程师被建议使用exploratory模式,Claude会在每次修改时解释架构、语言特性和代码库结构。还有learning模式,专为非程序员设计,会手把手教你完成操作而不是直接代劳。

写在最后

这场对话揭示了一个清晰的趋势:编码正在从瓶颈变成已解决的问题。软件工程师的价值正在向上游(创意生成、产品直觉、系统设计)和下游(部署、安全、运维自动化)迁移。Boris的团队以周或月为单位规划,因为"指数级变化太疯狂了,你只能抓紧,一步一步来"。

当被问到Claude Code未来一年的愿景时,Boris的回答简洁而有力:成为最强大的Agent,在任何团队工作的地方都能运行,让用户以其他产品无法提供的方式体验新模型的能力。

核心要点

分享:

相关推荐