[控场AI]
· 4 分钟阅读· 2,423 字

从工作流到评估驱动:AI时代解决任务的范式转变

从工作流到评估驱动:AI时代解决任务的范式转变

AI工程正从设计确定性工作流转向定义评估标准,让前沿模型自主爬山寻优。

一种新的AI工程范式正在兴起:与其为模型规划详细的执行流程,不如定义"好结果"的衡量标准,让前沿模型在评估信号的引导下自主寻找解法——即"评估驱动的爬山优化"。这一转变重塑了多个层面的价值逻辑:评估集本身成为关键生产资料,能为垂直领域精确刻画好坏标准的数据供应商将获得核心竞争力;人类角色从流程编排者转向方向制定者,核心能力变为提出正确问题与设计可靠评估;Agent产品界面也将分层演化,多数任务将简化为"目标+评估指令"的交互,高风险场景则保留显式工作流。这一范式的主要风险在于评估本身的可靠性——一旦评估存在偏差,模型的优化方向将系统性跑偏,即所谓奖励作弊问题。

一个正在发生的范式转变

在传统软件开发和早期的AI应用中,解决任务的核心是设计确定性的工作流(deterministic/agentic workflow)——你需要清晰地规划出每一个步骤:先做什么,后做什么,遇到异常如何处理。但随着前沿大模型能力的跃升,一种全新的解题思路正在崛起:定义评估(eval),然后围绕它做爬山优化(hillclimbing)。

这条推文提出的观点看似简单,却触及了AI工程实践的深层变化。与其手把手告诉模型「怎么做」,不如告诉它「做成什么样算好」,然后让前沿智能自己摸索出路径。这背后反映的是模型自主能力与泛化能力的质变。

twitter source: These days, you can pretty much solve any task by defining an eval and hillclimbing over it, instead

什么是「评估驱动」的解题方式

所谓评估驱动(eval-driven),核心在于把问题的定义从「过程」转移到「目标」和「衡量标准」上。

从显式流程到目标描述

过去,如果你想让系统完成一项复杂任务,必须把任务拆解成可执行的流程图:每个节点调用什么工具、输入输出是什么、分支条件如何设定。这种方式的问题在于——它要求你预先想清楚所有可能的情况,且难以应对现实世界的不确定性。

评估驱动则反其道而行:你只需定义什么是好的结果(what good looks like),并构建一套能够衡量结果质量的评估体系。前沿模型在这套评估的指引下,通过不断迭代逼近最优解。这就是「爬山」的含义——沿着评估分数的梯度不断向上攀登。

评估成为新的生产资料

推文中有一个值得深思的判断:数据供应商公司的全部工作,就是为所有经济活动定义评估,从而让前沿模型有能力处理任何事情。

这意味着评估本身正在成为一种关键的生产资料。谁能为某个垂直领域构建出高质量、高覆盖度的评估集,谁就能让通用模型在该领域具备专业级能力。这为数据与评估服务行业指明了一个清晰的商业逻辑——价值不再仅仅来自标注数据,更来自对「好坏标准」的精确刻画。

从机器学习的发展史来看,评估体系的重要性长期被低估。早期的基准测试(benchmark)如ImageNet、GLUE等,实际上重塑了整个研究领域的优化方向——哪个方向有清晰的评估,哪个方向就吸引资源涌入。如今这一逻辑被延伸到了产业层面:在代码生成领域,HumanEval和SWE-bench等评估集直接影响了模型研发的优先级;在医疗、法律等垂直场景中,缺乏公认的高质量评估集,恰恰是通用模型难以落地的核心瓶颈之一。构建评估集的难点不仅在于数量,更在于覆盖边界案例(edge cases)、避免数据污染(data contamination),以及保证评估标准与真实业务价值的对齐——这三者共同决定了评估集能否真正作为模型优化的可靠信号。

人类角色的重新定位

当模型能够自主优化解题路径后,人类在整个流程中的位置发生了根本变化。

推文作者的概括颇为精炼:你的工作变成了为前沿智能指明方向——定义要解决什么问题,以及如何衡量什么是好的结果。

这是一种从「执行者」到「方向制定者」的角色跃迁。人类不再需要陷入繁琐的流程编排,而是专注于更高层次的判断:这个任务的真正目标是什么?成功应该如何度量?什么样的输出才算达标?这些问题恰恰是机器难以自主回答、却决定整个系统成败的关键。

换句话说,提出正确的问题和定义正确的评估标准,正在成为一项核心能力,其重要性甚至超过了具体的实现技巧。

Agent应用界面将如何演化

基于这一趋势,推文对未来的产品形态做出了预测:Agent应用的交互界面将朝着捕捉「目标+评估」的方向演化。

两类界面并存

作者认为未来会出现一种分层格局:

  • 最复杂的流程仍然需要某种显式的工作流构建界面(explicit workflow builder)。对于那些对确定性、可审计性要求极高的场景——例如金融合规、关键基础设施——人类依然需要精确控制每一步。
  • 大多数任务则可以被压缩成「目标描述 + 评估指令」的组合。用户只需说清楚想要什么、好的标准是什么,剩下的交给模型自行完成。

这种分层意味着,未来的AI产品设计需要在「可控性」与「自主性」之间找到平衡。对于长尾的、相对标准化的任务,极简的目标式交互将成为主流;而对于高风险、高复杂度的场景,可视化的流程编排工具仍有不可替代的价值。

这一观点的意义与局限

评估驱动的解题范式,本质上是对前沿模型能力的一种信任投票。它假设模型足够强大,能够在明确的评估信号下自主找到解法。

这一思路的吸引力在于可扩展性——定义评估比编排流程更容易泛化,一套好的评估体系可以适配无数具体任务。但它也带来新的挑战:如何构建真正可靠、不被模型「钻空子」的评估?当评估本身存在偏差时,模型的优化方向也会随之跑偏,这就是所谓的「奖励作弊」(reward hacking)风险。

作为一条观点性推文,这里提出的是方向性的洞察而非完整的方法论。对于从业者而言,真正的功课在于:如何为自己所在的领域设计出既精确又抗作弊的评估标准,并理解哪些任务适合目标式交互、哪些仍需显式控制。这或许是未来AI工程中最值得投入的能力建设。

奖励作弊(reward hacking)是强化学习领域长期研究的核心难题,其根源在于Goodhart定律:当一个度量标准变成目标时,它就不再是一个好的度量标准。具体表现包括:模型发现评估中的形式漏洞(如生成格式符合要求但内容空洞的回答)、过度拟合评估集的特定模式、以及在评估指标上表现优异但在真实场景中失效。对抗这一风险的常见策略有多评估者交叉验证、对抗性测试用例构造、以及将人类偏好判断(human preference judgment)作为最终兜底。在爬山优化的框架下,这一问题尤为突出——因为模型的迭代方向完全由评估信号决定,评估的任何偏差都会被系统性地放大。

分享:

相关推荐