AI Agent时代工程师的三大角色转变:从编码者到系统设计者

当Agent开始承担长周期任务
在近期的 aiDotEngineer 大会上,知名开发者 @steipete 提出了一个值得深思的观点:随着 AI Agent 逐渐能够承担长时间运行的工作任务,软件工程的重心正在发生根本性转移。工程师不再是亲手敲下每一行代码的执行者,而是逐步演变为方向的设定者、成果的审查者和系统的设计者。
关于 aiDotEngineer 与 @steipete
aiDotEngineer 是专注于 AI 工程实践的开发者大会,汇聚了一线 AI 应用开发者与框架构建者,是观察 AI 工程前沿动态的重要窗口。Peter Steinberger(@steipete)是知名的 iOS 开发者和开源贡献者,创立了 PSPDFKit(现更名为 Nutrient),近年来深度转型为 AI 工程领域的活跃声音。其观点因兼具一线工程实践经验与产品视角而广受关注——他不是在实验室中讨论 AI,而是在真实产品开发中持续与 Agent 系统打交道,这赋予了他观察的独特可信度。
这一转变听起来简单,背后却蕴含着软件开发范式的深刻变化。过去几十年,工程师的核心价值在于将需求转化为可运行的代码。而当模型已能自主完成从规划到实现的完整链路,人的价值坐标正在被重新定义。
从写代码到设定方向
方向决定成败
传统开发流程中,工程师往往深陷于具体实现的细节:如何优化一个循环、如何设计类的继承关系、如何处理边界条件。当 AI Agent 能够接手这些工作时,工程师的注意力必须上移到更高层次——明确要解决什么问题,以及为什么要这样解决。
设定方向要求工程师具备更强的产品思维和系统抽象能力。你需要清晰地告诉 Agent 目标是什么、约束条件有哪些、优先级如何排序。一个模糊的方向会让再强大的 Agent 也走向错误的终点。换句话说,提示词与目标设定的质量,直接决定了 Agent 产出的上限。
提示词工程的技术深度
提示词工程远不止于"问一个好问题"。在 Agent 场景下,系统提示(System Prompt)需要精确定义 Agent 的角色边界、工具使用规范、输出格式约束和错误上报机制。高质量的提示设计借鉴了形式化规格说明(Formal Specification)的思路,通过明确前置条件、后置条件与不变量来约束 Agent 行为。此外,Chain-of-Thought(思维链)提示和 Few-shot 示例的设计,直接影响模型在复杂推理任务上的准确率。研究显示,专业的提示设计可将复杂任务的 Agent 完成率提升 30%–50%,这正是"提示词与目标设定质量决定 Agent 产出上限"这一判断的技术依据。
长周期任务带来的新挑战
@steipete 特别强调了"longer-running work"(长周期运行任务)这一前提。早期的 AI 编程助手以即时响应为主——你问一个问题,它给一个答案。而新一代 Agent 能够在数分钟乃至数小时内持续工作,自主分解任务、调用工具、迭代修正。
这一能力跃升的背后有明确的技术支撑:现代 Agent 框架(如 LangChain、AutoGPT、Claude 的 Computer Use 等)通过 ReAct(Reasoning + Acting)范式,让模型在执行过程中不断观察环境、推理下一步行动并采取行动,形成闭环。ReAct 范式由谷歌研究院于2022年提出,其核心创新在于将语言模型的推理过程与外部工具调用交织在同一生成流中——模型在每一步都先"思考"(Thought)再"行动"(Action),并将行动结果作为新的"观察"(Observation)纳入下一轮推理。这一设计显著降低了模型幻觉率,并赋予 Agent 在复杂任务中自我纠错的能力。
支撑长周期任务的另一关键技术突破,是工具调用(Function Calling / Tool Use)接口的标准化成熟。Anthropic 和 OpenAI 分别于2023年推出的原生工具调用 API,使模型能够以结构化方式可靠调用代码解释器、浏览器、文件系统等外部环境,将"推理"与"行动"之间的工程实现复杂度大幅压低。正是这一标准化接口,才真正让 Agent 从"能够谈论如何操作工具"进化为"可靠地使用工具完成工作",构成了长周期自主执行能力的硬件基础。
长周期任务的实现还依赖于持久化上下文管理。然而,即便是支持200K token的大型模型,在数小时连续运作中积累的执行历史也会迅速填满上下文窗口。业界的应对策略包括:滑动窗口摘要(将历史压缩为结构化摘要保留关键信息)、外部向量数据库检索(按需召回相关历史片段),以及层级式任务分解(将长任务拆分为独立子任务,每个子任务维护独立上下文)。这些架构选择直接影响 Agent 在长周期执行中的方向一致性与错误累积率,使得 Agent 能够跨越单次对话的限制持续运作。
多Agent编排:长周期任务的另一维度
除了单一 Agent 的持久化运行,长周期复杂任务越来越多地采用多 Agent 编排(Multi-Agent Orchestration)架构:一个"编排者"(Orchestrator)Agent 负责任务分解与进度协调,多个"执行者"(Worker)Agent 并行处理子任务,并将结果汇报给编排者进行整合与验证。这一架构类比于软件工程中的微服务设计思想,通过职责分离和并行化显著提升了整体吞吐效率。OpenAI 的 Swarm 框架、Anthropic 推荐的 Multi-Agent 模式以及 LangGraph 等工具,都是这一编排思路的工程化实现。多 Agent 架构同时也引入了新的复杂性:Agent 间的通信协议设计、状态一致性保障和错误传播隔离,成为系统设计层面的新课题。
这种能力跃升随之带来新的问题:如何确保 Agent 在漫长的执行过程中不偏离既定方向?这正是"设定方向"这一职责变得如此关键的根本原因。
从执行到审查产出
第二个转变是审查工作(reviewing work)。当 Agent 持续产出大量代码和方案时,工程师的核心任务从"生产"变成了"把关"。
这实际上是认知强度更高的工作模式。值得注意的是,微软研究院2023年的调查发现,开发者在审查 AI 生成代码时存在显著的"自动化偏见"(Automation Bias)——倾向于对 AI 产出降低批判性审视强度。
自动化偏见的认知科学根源
自动化偏见(Automation Bias)这一概念由 Lisanne Bainbridge 等航空心理学研究者于1990年代系统化提出,最初用于描述飞行员过度信赖自动驾驶仪导致判断力下降的现象。其核心神经机制在于:当人类感知到"系统具备权威性或高可靠性"时,前额叶皮层的主动监控投入降低,认知模式从"分析模式"切换至"确认模式"。在 AI 代码审查场景中,这一效应与流畅性启发式(Fluency Heuristic)叠加放大:AI 生成的代码往往格式规范、注释完整、命名一致,视觉上比人工草稿更"专业",大脑会将这种表面流畅性错误映射为"内容正确性"的信号,进一步压低批判性审视的触发阈值。这意味着,在 AI 代码审查场景中,仅凭传统的代码审查直觉是远远不够的——工程师需要刻意培养针对"AI 特有失效模式"(如幻觉式 API 调用、表面正确但语义错误的逻辑、安全漏洞掩盖)的元认知识别能力。
与此同时,AI 生成代码往往在表面逻辑正确的掩盖下隐藏微妙的语义错误或安全漏洞(如不安全的反序列化、竞态条件等)。这意味着审查 Agent 产出不仅需要快速读懂一段自己未曾亲手编写的代码,判断其正确性、效率与潜在风险,更需要刻意训练识别"模型特有失效模式"的元认知能力,而非仅凭传统代码审查直觉。
某种程度上,这类似于资深工程师 review 初级工程师代码的过程,只是那位"初级工程师"变成了永不疲倦、产出量惊人的 AI。审查的效率与准确性,因此成为团队整体生产力的新瓶颈。
从编码到系统设计
围绕模型设计更好的系统
第三个也是最具战略意义的转变,是"designing better systems around the models"——围绕模型设计更好的系统。
这句话揭示了一个深层真相:单纯依赖模型本身的能力是不够的。真正决定 AI Agent 工作效果的,往往是它所处的"脚手架"(Scaffolding)——包括工具链设计、上下文管理、反馈回路构建和错误恢复机制等。
Scaffolding 系统的技术含义
Scaffolding 在 AI 工程语境中,指围绕核心语言模型构建的一整套支撑性基础设施。它包括:工具调用层(让模型访问外部 API、数据库、代码执行环境)、记忆与上下文管理(短期工作记忆与长期向量检索)、错误处理与重试机制,以及多 Agent 协调协议(如 OpenAI 的 Swarm 或 Anthropic 的 Multi-Agent 框架)。研究表明,相同的基础模型在不同 Scaffolding 设计下,任务完成率可能相差数倍。因此,Scaffolding 设计能力已成为 AI 工程师最具竞争壁垒的核心技能之一。
其中,检索增强生成(RAG)架构是现代 Scaffolding 的关键组件之一。RAG 最初由 Meta AI 研究院于2020年在论文《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》中正式提出,其原始设计面向静态知识问答场景。在 Agent 工程化应用中,RAG 已演进为动态、多源、分层的检索体系:在模型生成回复前,先从外部向量数据库中检索与当前任务语义最相关的文档片段注入上下文——不仅用于知识问答,更用于实时提供代码库上下文、历史执行记录、API 文档和业务规则等动态信息。高级 RAG 架构(如 HyDE、Self-RAG)进一步引入假设文档生成和自我反思机制,使 Agent 获取信息的精度与质量大幅提升,是"围绕模型设计更好系统"最具代表性的工程实践。
优秀的工程师需要思考:如何给 Agent 提供恰当的工具?如何组织信息让模型更易理解?如何设计验证机制来捕捉错误?这些系统层面的设计工作,正是 **AI Engineering(AI 工程)**这一新兴学科的核心所在。
AI Engineering 作为新兴学科
AI Engineering 区别于传统机器学习工程(ML Engineering)——后者侧重于模型训练、调参与部署,而前者更关注如何将已有的基础模型(Foundation Model)集成到实际产品与工作流中。AI Engineering 的核心议题包括:提示词工程与系统提示设计、检索增强生成(RAG)架构、Agent 编排与工作流自动化,以及模型评估体系(Evals)的构建。值得特别指出的是,Evals 填补了一个关键工程空白:传统软件工程处理确定性系统,给定相同输入产生相同输出,可通过单元测试完整验证;而 AI Engineering 面对的是概率性系统,错误模式非结构化,传统测试框架难以覆盖。Evals 通过构建基准测试集、使用"模型评估模型"(LLM-as-Judge)等方法,对 Agent 行为进行统计意义上的质量保障。斯坦福大学 2024 年 AI 指数报告指出,AI Engineering 相关职位需求在过去两年增长超过 200%,正在成为软件工程领域增速最快的细分方向。
人与Agent的协作架构
围绕模型设计系统,本质上是在构建一种新型人机协作架构。在这个架构中,Agent 负责繁重的执行工作,人负责高层决策、质量保障与持续优化。方向设定、成果审查、系统设计——三者共同构成了未来工程师的核心能力矩阵。
人在回路(Human-in-the-Loop)的架构设计原则
"人与 Agent 协作架构"在工程实践中对应一个重要设计模式:Human-in-the-Loop(HITL)。HITL 并非简单地"让人监督 AI",而是在系统架构层面精心设计人类介入的时机与粒度——在哪些决策节点需要人类确认,在哪些环节可以完全自主执行,出现什么类型的异常时需要升级给人类处理。过度介入会抵消 Agent 的效率优势,介入不足则带来不可控的风险。优秀的 HITL 设计需要基于任务的风险等级、可逆性和不确定性来动态调整人类参与强度,这本身就是一项需要深厚工程判断力的系统设计工作。
对工程师的能力升级启示
这一趋势对每位从业者都提出了明确的升级要求:
- 抽象能力比编码速度更重要,因为你需要设定清晰的方向;
- 判断力比记忆力更重要,因为你需要快速审查海量产出,同时抵抗"自动化偏见"的干扰;
- 系统思维比局部优化更重要,因为你需要为模型构建更好的运行环境。
需要澄清的是,这并不意味着底层技术能力变得无足轻重。恰恰相反,只有扎实的技术功底,才能支撑有效的方向设定与成果审查——你需要理解 ReAct 范式才能设计合理的 Agent 行为边界,你需要懂得上下文管理才能评估 Scaffolding 架构的优劣,你需要理解概率性系统的失效模式才能构建有效的 Evals 体系。变化的是能力的应用方式,而非能力本身的价值。
结语
@steipete 在 aiDotEngineer 上的这番观察,虽是简短数语,却精准捕捉到了 AI 时代软件工程演进的方向。当 AI Agent 逐渐接管长周期执行工作,工程师的价值不会消失,而是向上迁移——从代码的编写者,成长为智能系统的设计者、指挥者与守护者。
对于每一个身处这场变革中的工程师而言,主动拥抱这三大角色转变,或许正是在 AI 时代保持核心竞争力的关键所在。
核心要点
相关推荐

特朗普手机悄然涨价250美元,T1 Phone定价升至749美元
Trump Mobile旗舰T1 Phone从499美元悄然涨至749美元,涨幅达250美元,硬件配置未做任何升级。深入分析特朗普手机静默涨价背后的供应链压力、品牌定价策略及市场竞争困境。

DeepSeek V4-1 Flash发布:552B参数MoE多模态模型支持百万上下文
DeepSeek发布V4-1 Flash多模态大模型,采用552B参数混合专家架构(MoE),支持100万tokens超长上下文窗口。深入解析其MoE架构、多模态能力、成本优势及对AI行业的影响。

沃尔沃XC40插混版回归:传感器升级+Gemini AI加持
沃尔沃XC40 PHEV插电式混动版时隔三年重返市场,带来全新外观设计、升级传感器套件及谷歌Gemini AI车机系统。了解这款车型的核心升级亮点、插混回归的市场逻辑及生成式AI进入座舱的深远意义。