[控场AI]
· 7 分钟阅读· 3,630 字

CAD World基准:AI Agent画工程图为何只有17.5%成功率

CAD World基准:AI Agent画工程图为何只有17.5%成功率

CAD World基准测试揭示:最强AI智能体操作机械CAD的成功率仅17.5%,远低于人类专家的87%。

CAD World是首个专门针对机械CAD长流程工作流的计算机操作智能体评测基准,包含200个任务,覆盖草图、建模、装配、仿真等11类工作流和183个知识点,基于开源FreeCAD构建。与以往CAD相关AI研究绕过GUI、直接生成代码或几何模型的路线不同,CAD World要求智能体像人类工程师一样通过图形界面操作软件,并以真实保存的CAD文件作为评估依据。测试结果显示,七个主流智能体中最强的GPT-5.4成功率仅17.5%,而人类专家高达87%;且低能力模型失败在执行环节,高能力模型的失败则集中在工程语义一致性上,说明下一个技术瓶颈在于理解工程设计逻辑,而非单纯的界面操作能力。

CAD自动化的评测空白终于被填补

计算机操作智能体(Computer-Use Agent)近来发展迅猛,它们能看懂软件界面、自动操作鼠标键盘完成用户指令,与传统调用特定API的工具不同,其核心是模拟人与图形界面交互的过程。但过去的评测基准大多集中在网页操作和普通桌面软件上,很少涉及CAD这类专业工程软件。

一篇名为CAD World的新研究,专门针对机械CAD领域的长流程任务做评测,成为首个面向机械CAD长流程工作流的计算机操作基准。这个领域的自动化一直是难题——CAD对操作精度和状态追踪的要求远高于普通软件,刚好能测出当前智能体的真实能力边界。

测试了七个主流计算机操作智能体

结果颇具冲击力:一共测试了七个主流计算机操作智能体,跑完全部200个任务后,最强的GPT-5.4成功率仅有17.5%,而人类专家的成功率是87%。这个巨大的鸿沟,正是CAD World想要暴露的核心问题。

计算机操作智能体(Computer-Use Agent)的技术路线与传统RPA(机器人流程自动化)有本质区别。RPA依赖预先录制的脚本或硬编码的界面元素定位,一旦软件版本更新或界面布局变动就会失效。计算机操作智能体则通过视觉语言模型(VLM)实时解读屏幕截图,动态决定下一步操作——类似于让模型"看着屏幕思考",而非按固定剧本执行。这使得它们理论上能应对界面变化和未曾见过的操作场景,但也带来了推理链条长、错误累积、操作精度难以保障等新挑战,这正是CAD这类高精度专业软件能充分暴露其局限的原因。

为什么CAD场景如此之难

画一个机械零件可能需要上百步操作,一步错后面全错。论文归纳了CAD场景的几大核心难点。

从2D界面推理3D结构是第一道门槛。两条线看起来挨在一起,实际要判断它们是否重合、平行,这些几何关系的理解并不简单。操作精度要求极高是第二个难点,点错一个按钮、输错一个参数,整个模型的约束关系就会全乱,而且错误会一直传递到后续步骤,很难修正。

更关键的是后两点。真实的CAD工作流都是长流程,往往需要几十到上百步操作,跨越草图、特征树、装配、仿真多个模块,智能体必须记住前面的操作状态并跟着流程调整策略。同时,结果正确性不能只看外观:两个模型看起来一模一样,可能尺寸差0.1毫米、约束关系不同,后续生产或仿真就会出问题。合格的模型必须是可编辑、可测量、符合工程规范的,这与普通软件只要完成表面操作就达标完全不是一个标准。

此前不少CAD相关AI研究走的是生成CAD代码或几何模型的路线,跳过了GUI界面。但现实里工程师都是对着GUI操作,不会写代码生成模型。生成代码再运行,等于把中间最核心的交互过程都省略了——如何从界面里找到当前需要修改的特征、如何验证改完的结果,这些能力根本测不出来。CAD World的核心思路正是让智能体和人类工程师用一样的GUI交互,考验它能否通过界面感知、操作、验证工程状态。

参数化建模是现代机械CAD软件的核心范式,与早期的直接建模(Direct Modeling)有本质区别。在参数化建模中,模型由一系列有序的特征操作(Feature Tree)构成,每个特征都保存着可修改的参数和几何约束关系。修改早期步骤的参数,后续所有依赖该参数的特征会自动重新计算。这种设计让工程模型具备可编辑性,但同时也意味着操作顺序极为关键——在错误的状态下执行正确的命令,或在正确步骤上输入错误参数,都会导致约束求解器失败或产生无效几何体。智能体不仅要知道"做什么",还要理解当前特征树的状态,判断自己处于哪个建模阶段,这对上下文状态追踪能力要求极高。

200个任务与四大评估特性

CAD World包含200个任务,覆盖11个工作流类别、183个不同知识点,范围涵盖草图绘制、零件建模、装配、制造(CAM)、编程、仿真、测量、工程图等机械设计全流程。其中草图类63个任务(60个知识点)、零件建模类77个任务(61个知识点)占据大部分,还包括倒角、圆角等此前很多CAD数据集很少覆盖的实际工程操作。

所有任务对齐成熟的机械CAD/CAM知识体系

每个任务配置都很完整,包含自然语言指令、初始软件状态、可选参考素材和自动执行的评估器。智能体只能通过屏幕截图看界面、输出鼠标键盘操作,最终评估看的是保存的CAD文件本身是否正确,而非文字回答或视觉相似度。哪怕做出来的模型看起来像个三角棱柱,只要结构、几何参数或建模过程不符合要求,照样算失败。

评估器设计满足四个特点:可追溯(所有截图、日志、评估结果都能对应,知道哪一步出错)、可测量(尺寸、约束、仿真结果自动检查)、可诊断(失败时能定位到缺对象、属性不匹配、公差超标还是执行错误)、可编辑(保存的文件能直接用原软件打开修改)。为实现这些,作者选用开源的FreeCAD作为运行环境,免费可分发、有完整GUI支持,便于其他研究者复现。

整个标注和验证过程花了约三个月、1300人时,指令中位数长度63个词,任务来源包括FreeCAD工作台功能、CAD教程文档和常见机械设计工作流。

17.5%背后:失败阶段在后移

实验中所有模型运行都在统一的CAD World运行器里进行,FreeCAD跑在预构建的Ubuntu虚拟机中,用Docker和QEMU管理。智能体没有任何特权,不能直接访问文件或调用API,每个任务最大100步。

专家的最优操作路径作为效率锚点

结果的对比相当悬殊。人类专家成功率87%、平均仅需26.5步;而最强的GPT-5.4成功率17.5%、完成率62.5%、平均动作步数104.6步,成功任务平均也要46.9步,几乎是人类的两倍。第二名Opus-4.8成功率16%、平均成本10美元一个任务。其余模型表现更差:Kimi K2.6为7.5%,OpenCUA 1.5%,还有两个模型成功率直接为0,且这些低性能模型动作步数反而更多,基本都在做无效操作甚至陷入死循环。

一个有价值的规律是:随着模型能力提升,失败阶段会往后移而非直接消失。低性能模型大多在执行环节失败、产不出有效工件;GPT-5.4和Opus-4.8这类强模型大多能保存出可读的CAD项目,但失败原因变成了文档结构错误、几何错误、建模流程错误。这说明通用UI交互问题解决之后,下一个瓶颈是在整个工作流里保持工程语义的一致性——不仅要会点界面,还要懂工程设计的逻辑和规则。

与已有基准的差异及未来价值

通用计算机操作基准如WebArena主要测网页交互,OSWorld扩展到普通桌面应用,OSWorld 2.0开始涉及长流程,但CAD只是其中很小一部分,没有系统覆盖草图约束、参数化建模、装配、CAM等专业内容。专门的CAD基准如ABC、Fusion360Gallery、Text2CAD等,大多测几何生成或代码生成,不需要操作GUI,流程也短。

当前差距依然巨大

CAD World在GUI交互、原生可编辑、精确参数化表示、人类专家编写任务、任务特定评估、长流程(均超40步)这几个维度上同时满足,填补了空白。它的价值不止于评测:每个任务都有专家演示轨迹、完整状态和评估标准,可用来微调专门的CAD操作智能体。

研究者也坦承差距巨大。17.5%的成功率只能算刚入门,离商用还很远;真实工业设计场景可能有上千步操作,涉及更多跨模块协作与标准规范。但CAD World的思路可以复用到电子设计自动化、建筑设计、音视频剪辑等其他专业软件领域,推动计算机操作智能体从通用场景走向垂直专业场景。这项研究最值得肯定之处,是没有为提高成功率而简化任务或给模型开特权,而是把真实工业场景的难点完整暴露给AI社区——只有直面真实难点,技术才能真正落地。

FreeCAD是一款基于OpenCASCADE几何内核的开源参数化CAD软件,支持零件设计、装配、FEM仿真、CAM路径规划等多个工作台,是目前功能最完整的开源机械CAD平台之一。相比商业软件如SOLIDWORKS或Fusion 360,FreeCAD可免费分发、支持Python脚本自动化,且能通过命令行或API读取内部模型状态,这为CAD World的自动评估器实现精确的几何参数检查(如尺寸、约束状态、拓扑结构)提供了技术基础。选择FreeCAD也意味着基准可被任何研究者在本地复现,无需商业软件许可证,有助于降低后续社区研究的门槛。

分享:

相关推荐