Claude与GPT操控机械臂绘画对决:谁更胜一筹?

开发者用同一台SO-101机械臂对比Claude与GPT的绘画控制能力,实验触及具身智能的核心挑战。
一位开发者将Claude Fable 5.1与GPT 6 Astra分别接入同一台SO-101开源机械臂,让两款模型完成「单色填充预设形状」的绘画任务并对比结果。相比此前流行的「复现图像」方式,这一改动将评测聚焦于边界识别、路径规划和执行精度等更纯粹的维度。结果显示两款模型填充完成度相近,但在均匀度、边界处理等细节上存在差异。作者刻意不公布结论,交由社区盲评,并透露朋友们的共识「出乎意料」,暗示品牌预期与实际表现可能存在落差。这一实验虽属小样本非正式测试,却提出了一个更深层的问题:随着大模型加速进入物理世界,我们该如何设计公平可复现的具身任务评测体系?
一场有趣的机械臂绘画实验
一位开发者在Reddit上分享了一个别开生面的实验:他分别把两款前沿大模型(Claude Fable 5.1 与 GPT 6 Astra)接入同一台 SO-101 机械臂,让它们各自完成同样的绘画任务,再对比两者的表现。
这个实验的灵感来自此前在 X(原 Twitter)上流传的一则帖子——有人让 GPT 6 Astra 操控 SO-101 机械臂去画金门大桥。原帖以还原一张参考图像作为基准,而这位开发者把任务做了改动:不再以复现图像为目标,而是让模型用单一颜色填充预设的形状区域。

任务的改动其实很关键。复现图像考验的是模型对整体构图、色彩和比例的把握,而单色填充形状更聚焦于边界识别、路径规划和执行精度——模型需要理解形状轮廓,规划机械臂的移动轨迹,并尽量把颜色填满而不越界。这让评测维度变得更纯粹,也更容易做横向比较。
两个模型的表现如何
据发帖者描述,两款模型最终产出的画作在形状填充的完成度上相当接近,单从「填得满不满」这个直观指标看,很难拉开明显差距。
但魔鬼藏在细节里。作者提到,画作之间「有一些值得讨论的地方」,也就是说在填充的均匀度、边界的处理、笔触的连贯性等更精细的层面,两者存在可以品评的差异。这类差异恰恰反映了模型在空间推理与动作控制上的细微能力区别——一个模型可能填色更均匀但偶尔越界,另一个可能边界更干净但覆盖率略低。
有意思的是,作者把结果拿给几位朋友看,得到的共识结果「出乎意料」。他没有直接公布哪个模型胜出,而是把这个问题抛给了社区,邀请大家来评判。这种「盲评」式的呈现方式,某种程度上比作者自己下结论更有价值——它避免了先入为主的品牌偏好,让评价回归画面本身。
为什么这类实验值得关注
把大语言模型接入物理机械臂并让其完成绘画,看似是一个「玩票」性质的项目,背后却触及了当前 AI 领域一个重要方向:具身智能(Embodied AI)。
从文本到物理动作的跨越
大模型擅长处理文本和图像,但要让它可靠地控制物理设备,需要把高层的任务理解(「填满这个形状」)转化为一连串精确的低层动作指令(机械臂关节角度、移动路径、下笔力度等)。这个转化过程极其考验模型的规划能力和对空间的理解。绘画任务恰好是一个直观的测试载体——结果好不好,肉眼就能看出来。
在技术实现层面,大模型控制机械臂通常依赖一套「感知-推理-执行」的链路。模型首先通过摄像头获取当前画面(视觉输入),理解形状轮廓与当前笔尖位置的空间关系,然后生成动作序列(如「向右移动5毫米、下压1毫米」),再由驱动程序将这些指令翻译成机械臂各关节的电机控制信号。整个过程中,模型需要持续做闭环反馈——每次落笔后重新感知画面,判断是否偏离预定路径并及时修正。这对模型的推理速度和空间坐标系理解提出了很高要求。目前业界常用的技术路径包括:直接提示工程(让模型输出坐标序列)、Code-as-Action(让模型生成控制脚本)以及专门训练的视觉-动作模型(如RT-2、π0等)。这次实验更接近前两种路径,属于将通用大模型「零样本」迁移到物理控制场景的探索。
标准化硬件带来的可比性
实验使用的 SO-101 是一款相对普及的开源机械臂平台。用同一台硬件、同一个任务去测试不同模型,排除了硬件差异的干扰,让对比更公平。这也是社区做模型能力评测时值得借鉴的思路:控制变量,聚焦模型本身。
SO-101是由Hugging Face与硬件社区合作推出的低成本开源机械臂,定价约在100美元级别,设计目标是让研究者和开发者能以极低门槛复现具身AI实验。它采用串行总线舵机驱动,配合LeRobot等开源框架,可以方便地接入Python控制脚本或大模型API。正是因为SO-101的开源性和普及性,近期它成为社区验证具身智能想法的「标准实验台」,类似于计算机视觉领域的MNIST数据集——足够简单、可复现,但依然能暴露模型能力的真实差异。这也意味着这次实验的方法论具有一定可推广性,其他开发者可以用同样的硬件和任务设置来独立验证或挑战结论。
评测标准的选择很重要
作者从「复现图像」改为「单色填充形状」,实际上是在重新定义评测的难度和维度。这提醒我们,评价 AI 能力时,任务设计本身会极大影响结论。填充形状降低了对色彩和构图的要求,却放大了对执行精度和边界控制的考察。不同的任务会让不同的模型「显得更强」,所以看待任何 AI 对比实验时,都需要先搞清楚它到底在测什么。
具身智能(Embodied AI)是指让AI系统拥有「身体」,通过与物理环境的实时交互来感知、推理和行动,而非仅在数字空间中处理信息。这一概念的核心主张是:真正的通用智能需要身体经验作为基础,就像人类的认知是在与物理世界的持续互动中形成的。与纯语言或视觉模型不同,具身AI面临的挑战在于物理世界的不可逆性、传感器噪声和实时响应需求——模型的一个错误指令可能直接导致硬件碰撞或任务失败,没有「撤销」的余地。当前具身智能的主流研究场景包括机器人导航、物体抓取、双手协作操作等,绘画任务因其结果可视化、评价直观,成为一个颇具传播价值的切入点。
社区评价的悬念
这篇帖子最大的看点,其实是作者刻意留下的悬念——他没有告诉大家哪个模型画得更好,反而对朋友们给出的「共识方向」感到意外。
这种做法值得玩味。在 AI 模型的讨论中,人们往往带着强烈的品牌预期:有人天然偏爱 Claude 的严谨,有人推崇 GPT 系列的通用能力。但当把品牌标签隐去、只看实际产出时,结论可能会颠覆直觉。作者的「意外」恰恰说明,模型的真实表现未必符合我们的刻板印象。
需要提醒的是,这毕竟是一次个人化的、样本量极小的非正式实验,评价也主要基于少数朋友的主观感受,并不能作为两款模型能力高下的严谨结论。它更像是一个引发思考的引子:随着大模型越来越多地被接入物理世界,我们该如何设计公平、可复现的评测方法,来衡量它们在具身任务上的真实能力?
这或许才是这场机械臂绘画对决留给我们最有价值的问题。
相关推荐

Krea 2 图像生成工作流入门:新手如何理清 LoRA 与 Checkpoint
针对 Krea 2 图像生成新手的入门指南,解析如何从免费开源工作流起步,理清 Civitai 上 LoRA 与 Checkpoint 的分工,并掌握写实图像一致性生成的关键技术要点。

Agent评估框架深度解析:自建还是采用现成工具?
深入解析Agent评估框架(eval harness)的四大核心组件——测试用例、执行器、捕获层与评分器,并探讨自建与采用现成框架的决策标准,助力AI工程团队构建可靠的智能体评估体系。

Valve Steam Frame头显:内存涨价打乱定价计划
Valve Steam Frame头显正式发布,但因全球内存和存储市场涨价,定价被迫超出原计划的1059美元。本文解析供应链成本压力如何影响VR硬件定价及行业趋势。