Anthropic 演讲解读:模型正在吞噬你的脚手架代码

Anthropic研究员揭示:过去手搓的Agent脚手架已被模型吸收,开发者应聚焦连接模型与自身业务的代码。
在Anthropic的Code with Claude大会上,研究产品经理Lucas提出核心论断:去年开发者不得不手工编写的脚手架代码——工具路由器、重试装饰器、输出校验器——正被模型本身快速吸收,这类代码的半衰期仅有几个月。演讲以"before/after"对比结构,覆盖工具使用、上下文管理、代码执行和计算机操作四大能力:工具路由器已可由模型自行完成并自我恢复;100万token上下文配合服务端压缩让记忆系统简化为几行配置;代码执行循环被收入单次API调用;Opus 4.7支持原生1440p截图与1:1坐标,OS World评测从不足50%跃升至78%。最终结论是:真正有价值的工作是把模型连接到开发者自己的工具、数据与业务上下文,而非修补模型的短板。
核心观点:去年你写的脚手架,今天随模型一起发货
在 Anthropic 的 Code with Claude 大会上,研究产品经理 Lucas 带来了一场主题鲜明的演讲,核心论点只有一句话:去年你不得不手搓的脚手架(scaffolding),今天已经直接内置到模型里一起发货了。
他建议开发者转变心智模型——不要再把模型当成一个纯粹的「输入输出」LLM 黑盒,而要把它看作一套围绕模型展开、不断扩展其能力的工具集(expanding toolkit)。这意味着大量重试逻辑、路由器、输出校验、上下文压缩的代码正在被模型本身「吸收」,开发者得以从繁琐的工程封装中解放出来,专注于真正想要的结果。
整场演讲以「before / after」对比的方式,覆盖了工具使用、上下文管理、代码执行和计算机操作四大能力,每一块都给出了实用技巧,并额外为 Claude Code 用户提供了专属 tips。
工具使用:告别脆弱的路由器与重试装饰器
一年前构建 Agent,本质是「围着模型造轮子」。你可能需要路由器来挑选合适的工具、重试循环来应对失败、输出校验器来兜底,还没开始写产品,就已经堆了上百行脚手架。
Lucas 直言,过去那种基于字符串匹配、启发式规则的工具路由器,本质上是「用 if 条件语句去猜测用户意图」。它们脆弱易碎,往往是你新增一个工具时第一个崩掉的地方。
而新范式下,模型已经足够聪明,可以自己在工具集中搜索并挑选正确的工具。**工具选择的准确率已经高到让预过滤和路由器反而会让效果变差。**当工具调用出错时,Claude 能看到错误、自行恢复并重新调用,不再需要外部的重试装饰器。

这里他给出一个高频使用的实用技巧:大多数开发者只告诉 Claude 工具的输入参数,但你其实还可以提供工具的输出 schema 描述。比如一个 search_docs 工具会返回 ID、标题、摘要和分数——提前告知 Claude 这些,模型在需要对结果排序时就知道有 score 可用,省去了一次 harness 往返。对 Claude Code 用户,他推荐使用 pre/post tool use hooks,在工具调用前后以编程方式拦截或记录。
**脚手架(Scaffolding)**是指开发者在调用 LLM 之外额外搭建的工程代码层,用来弥补模型能力的不足或不稳定性。典型的脚手架包括:工具路由器(根据用户意图决定调用哪个工具)、重试装饰器(捕获失败并自动重试)、输出校验器(检查模型返回值是否符合预期格式)以及规划器(将复杂任务拆解为多步子任务后再逐步执行)。早期大语言模型在工具调用的准确率和容错能力上较弱,这些脚手架是生产可用性的必要条件。随着模型本身能力的提升——尤其是原生函数调用(Function Calling)和工具使用能力的成熟——这些外部代码层的必要性正在快速下降,模型开始将这些逻辑内化为自身的推理能力。
Pre/Post tool use hooks 是 Claude Code 提供的编程拦截点,允许开发者在工具被调用之前(pre)或之后(post)注入自定义逻辑,例如记录审计日志、对工具参数做安全过滤,或对返回值做格式转换,而无需修改工具本身的实现。
上下文管理:从自建记忆系统到几行配置
长时间运行的 Agent 过去意味着你得自己造一套记忆系统:分块(chunking)、RAG、每隔 N 轮调用另一个模型做摘要、手动移动缓存断点来省钱……本质上都是为了「变相扩展模型的上下文窗口」。
Lucas 表示这一切都被大幅简化了。100 万 token 的上下文长度加上统一定价,先解决了大部分窗口压力;再配合服务端压缩(server-side compaction)和上下文编辑(context editing),剩下的工作就浓缩成了几行配置。这正是大会主题演讲中提到的「接近无限上下文窗口」的体感来源。

实用技巧方面,他建议每隔 N 轮主动清理工具结果——截图、搜索结果、文件读取这类「陈旧的工具输出」占用大量上下文,但 Claude 做出的决策已经写进了 transcript。只保留核心任务和决策,就能实时节省大量 token。对 Claude Code 用户,他强烈推荐运行 /context 命令,查看一个彩色网格,直观看到消息、工具结果、系统提示和 MCP 定义各占多少空间,并附带优化建议。
**RAG(Retrieval-Augmented Generation,检索增强生成)**是一种在上下文窗口有限时扩展模型可用知识的技术:将外部文档分块(chunking)后存入向量数据库,每次对话前先用用户查询检索最相关的片段,再将其拼入上下文提交给模型。过去上下文窗口普遍在 4K–32K token 以内,RAG 是绕开窗口限制的主流方案,但也带来了额外的检索延迟、嵌入成本和召回准确率问题。
**服务端压缩(Server-side compaction)**指由 API 服务提供方在服务端自动对超长对话历史进行摘要或截断,开发者无需自己调用额外模型来做「滚动摘要」。**上下文编辑(Context editing)**则允许开发者在会话进行中删除或替换历史消息,例如主动移除已过时的工具调用结果,从而节省 token 用量并降低模型因陈旧信息产生混淆的概率。两者结合,使原本需要数百行代码实现的记忆管理降低为少量 API 配置。
代码执行与计算机操作:循环搬进了单次 API 调用
过去的「写代码—运行—修复」循环是开发者的苦差事:找 VM 服务商、起沙箱、把模型输出的代码放进去运行、解析报错、再喂回模型,循环往复直到成功。

Anthropic 现在提供了代码执行工具,自动给 Claude 一个服务端托管的沙箱。上述整个循环现在发生在单次 API turn 内部,不再需要 Claude 与 VM 之间的往返。Lucas 建议把它理解成「给 Claude 配了一台专属电脑」——可以做无状态计算、数据分析、安装自定义库,而不会污染你的本地文件系统;只有当需要访问本地仓库或 Python 环境时,Claude 才会回到「真实世界」。
计算机操作(computer use)是进步最明显的一块。以前要让 Claude 操作 1080p 屏幕,得先把图像降采样到模型的像素限制内、记录缩放因子、再把模型点击的坐标放大回原始分辨率,还要包上重试和校验。Opus 4.7 现在可以直接拍摄原生分辨率截图,并返回 1:1 像素坐标,最高支持 1440p,覆盖了绝大多数显示分辨率,缩放数学彻底消失。
他还披露了一组关键数据:在衡量模型完成专业及消费级软件复杂任务能力的 OS World 评测上,不到 12 个月前 Claude 得分还不到 50%,而 Opus 4.7 已报告 78%,正逼近 80%。对于 4K 等超高分辨率仍建议本地降采样,而 1440p 以内则鼓励开发者尝试不同分辨率和图像格式(JPEG/PNG/WebP)以找到最佳组合。
OS World 是由学术界发布的计算机操作能力基准测试,要求模型在真实操作系统环境(Windows/macOS/Linux)中完成专业软件和消费级应用的复杂任务,例如用 LibreOffice 完成表格操作、在浏览器中执行多步骤网页任务等。它被认为是衡量「通用计算机 Agent」能力的较权威指标,因为任务覆盖范围广、需要视觉理解与精准操作协同,比单纯的 UI 点击基准更能反映真实世界的泛化能力。该基准满分为 100%,人类专家水平约在 72%–80% 区间,因此 Opus 4.7 报告的 78% 意味着模型在该评测上已接近或达到人类专家水准,是计算机操作领域的重要里程碑。
Claude Code 实战:浏览器里自己测、自己修

Lucas 演示了一个相当惊艳的闭环:Claude Code 可以借助 Chrome 浏览器会话(安装 Claude in Chrome 扩展),让 Agent 自己上网、测试本地开发环境。
演示中,一个项目管理面板有两个 bug:新建按钮不能添加卡片、卡片拖拽会落错列。Claude 的处理方式和人类 QA 几乎一致——打开 Chrome 复现问题,发现输入失败后进入代码修复,重新测试确认卡片创建成功;接着测试拖拽功能,发现把「review PR」误拖到了「to do」,识别出这是 drag-and-drop 的 bug,实时写修复、再从头重测整个流程。
这个闭环的价值在于:**今天的软件大多是为人类设计的,就必须以类人的方式测试。**赋予 Claude 浏览器和计算机操作能力,它就能自己复现、诊断、修复面向人类的软件 bug,而不需要开发者手把手把它牵到问题和解法面前。
结论:别再为模型的不可靠性写补丁
Lucas 用一句话收尾,也是整场演讲最该记住的原则:
任何为了弥补模型不可靠性而写的代码,半衰期只有几个月。
重试逻辑、路由器、规划器、校验循环——这些都在被、也会继续被模型吸收,这块工作应该留给 Anthropic。真正有价值、能够随时间复利增长的,是那些把模型连接到你世界的代码:你的自定义工具、数据、鉴权和专属上下文。「模型无法吸收它看不见的东西」,所以把这些给它,远比去补模型的短板更有意义。
他进一步预测,整个生态正朝同一方向演进——未来每一个软件都会给 Agent 开一扇「前门」。于是有趣的工作不再是让模型更可靠,而是你能在自己 Agent 前门的另一侧,放上别人无法复制的东西。
相关推荐

Qodo CEO详解AI代码审查:当「智慧」比代码本身更值钱
OpenAI DevDay 2026访谈:Qodo创始人Itamar Friedman详解AI代码审查如何从提示工程演进到群体工程,用wisdom base编码化工程隐性知识,让审查agent与编程agent协作,重新定义「任务」单位。

OpenAI DevDay 2026:Codex 从单人到多人协作的AI工作革命
OpenAI DevDay 2026 上 Codex 团队提出从单人到多人协作的 AI 工作范式:通过 app shot、持续型 agent dot、space 协作空间与可共享插件,让整个团队与 AI agent 在单一事实来源上协同,摆脱个人成为瓶颈的困境。

Databricks上线Workday Data Connect联邦连接器:Unity Catalog打通HR数据
Databricks宣布Workday Data Connect联邦连接器在Unity Catalog进入公开Beta,支持通过查询联邦直接访问Workday的HR与财务数据,实现统一治理与跨域分析,降低ETL工程负担。