VSArena开源VLA评测基准:纯视觉语言驱动的机器人排行榜

VSArena推出VLA专属赛道,强制策略仅凭视觉感知操作,从架构上杜绝"读取坐标"的作弊行为。
VSArena是一个面向机器人VLA(视觉-语言-动作)模型的开源评测基准,近期完成了一次关键架构更新。新增的VLA赛道严格隔离观测空间,策略模型只能接收128×128的RGB图像和自然语言指令,无法获取物体的精确三维坐标;而评分系统内部仍使用真实位姿,以保证打分的客观性。与此同时,项目将基于特权位姿的"state赛道"定位为纯调试沙盒,不纳入公开ELO排名,从制度层面杜绝了不同难度设定混淆的问题。公开排名仅来源于服务端托管的评测框架,浏览器内的Studio演示环境明确标注为仅供开发观摩,不提交成绩。整个项目仍处于单人早期开发阶段,服务端评测框架尚未上线,但代码与文档已完全公开。
一个专注于VLA评测的开源基准
机器人学习领域正在经历从「特权状态」向「纯感知驱动」的范式转变,而如何公平地评测这一转变的成果,一直是社区面临的难题。近日,开发者在 Reddit 上分享了 VSArena 项目的重要更新——它现在拥有了一条真正意义上的 VLA(Vision-Language-Action,视觉-语言-动作)赛道,并且完整的代码仓库与文档已经公开。
这次更新的核心不是新增功能,而是对评测哲学的一次重要修正。项目作者明确表示,这一改动直接回应了之前社区讨论中的反馈,尤其是关于「观测空间应当如何切分」的争议。

VLA赛道的核心设计:策略只能看到相机和语言
严格的观测空间隔离机制
VSArena 此次最大的变化,是把观测空间做了彻底的拆分。在新的 VLA 赛道中,策略模型(policy)只能获得一张 128×128 的 RGB 相机图像,外加一条自然语言的堆叠指令。也就是说,方块的精确位姿(cube poses)永远不会被传递给策略。
这一点非常关键。在许多机器人仿真基准里,模型往往可以直接读取物体的三维坐标——这被称为「特权状态」(privileged state)。虽然这能让训练更容易收敛,但它并不能反映真实世界中机器人只能依赖摄像头感知环境的处境。VSArena 的 VLA 赛道强制策略在「看得见但读不到坐标」的条件下工作,更贴近真实部署场景。
VLA(Vision-Language-Action)模型是当前具身智能领域的前沿架构,它将视觉感知、语言理解与机器人动作规划整合在一个统一的模型中。与传统的「感知-规划-执行」流水线不同,VLA 模型通常以预训练的大型视觉语言模型为骨干,将摄像头图像和自然语言指令作为输入,直接输出机械臂的关节角度或末端执行器的位移指令。代表性工作包括 Google 的 RT-2、OpenVLA 等。这类模型的核心挑战正在于:它们必须从像素级的视觉信息中估计出物体的空间位置,而非依赖预先标定的坐标数据,因此评测时观测空间的边界定义至关重要。
评分系统与策略输入的解耦
有意思的是,评分系统内部仍然会使用真实位姿来评估空间精度与任务完成度。但作者强调,这些真实位姿是**「仅裁判可见」(judge-only)**的,绝不会流入策略的输入。
这种「评分用真值、策略用感知」的设计,既保证了打分的客观准确,又维持了任务的挑战性。它体现了一个成熟基准应有的原则:评测标准的严格性,不应以牺牲任务的真实性为代价。
VLA赛道与State赛道的显式区分
作者特意保留了基于特权位姿的「state-based」赛道,但把它定位为独立的调试赛道(debug track),并且不会写入公开的 ELO 排名。
这个决定背后有清晰的考量。作者提到,他希望「VLA vs state」的区别是显式的、一目了然的,而不是需要用户去深挖才能发现的。在过去,很多基准把不同难度的设定混在一个榜单里,导致读者难以判断某个高分成绩究竟是靠强大的感知能力取得的,还是仅仅因为模型「作弊式」地读取了物体坐标。VSArena 通过赛道分离,从制度上杜绝了这种混淆。
换句话说,公开 ELO 榜单上的每一个分数,都代表着纯粹的视觉语言驱动能力,而调试赛道则为研究者提供了一个便于开发和排错的沙盒环境。
客户端物理与服务端评分的架构分工
Studio演示环境不参与排名
在此前的讨论中,社区曾对「客户端物理」的可信度提出质疑。毕竟,如果仿真运行在用户浏览器里,物理引擎的结果就可能被篡改或产生不一致,用它来生成公开排名显然不合适。
对此,作者做出了明确回应:浏览器内的演示环境 Studio 是**「仅供观摩与开发」(spectator/dev-only)**的,并且已经清晰标注,它不会向公开排行榜提交任何成绩。Studio 基于 Rapier/WASM 运行,能达到 60fps 的流畅体验,适合作为直观了解任务的入口,但它的定位仅止于此。
公开ELO排名来自服务端评分框架
真正的公开 ELO 只会来自一个托管的评测框架(hosted harness),所有打分都在服务器端完成。这从架构上保证了排名的公平性——评分逻辑不受客户端环境影响,也无法被提交者操纵。
不过作者也坦诚,这套服务端评测框架目前尚未上线,它是「让项目真正开放接受提交」之前唯一还欠缺的一块拼图。这也意味着,尽管代码与文档已公开,正式的社区提交暂时还需等待。
ELO 评分系统最初由匈牙利裔美国物理学家 Arpad Elo 为国际象棋设计,现已广泛应用于 AI 模型的竞技评测中(如 Chatbot Arena 对大语言模型的排名)。其核心思想是通过模型之间的相对比较而非绝对分数来衡量能力:每次对局后,胜者从败者处获得积分,获得的积分量取决于双方的预期胜率差距。ELO 体系的优势在于它能持续容纳新参赛者、自动处理不同对局数量的不均衡,并且对单次异常结果具有一定的鲁棒性。在机器人基准中引入 ELO 排名,意味着模型的能力通过与其他策略的相对表现来衡量,而非仅凭固定测试集上的绝对得分,这在任务设计持续演进的早期项目中尤为合适。
VSArena公开仓库与文档资源
目前 VSArena 的代码仓库和文档已经完全公开,托管在 GitHub(NovaCoding-G/VSArena)。其中几份文档尤其值得关注:
- docs/harness.md:评分写作说明,详细介绍了空间精度与任务完成度的评估方式;
- docs/sdk.md:提交协议,说明了如何接入评测框架;
- Studio 在线演示:基于客户端 Rapier/WASM 引擎,可在浏览器中以 60fps 运行。
作者表示这个项目仍是「单人开发、处于早期、还没到大力宣传的阶段」,态度相当务实。他特别开放地邀请社区继续提出反馈,尤其希望听到关于评分协议还可能遗漏了什么的意见。
社区反馈驱动的严谨演进模式
VSArena 这次更新的意义,或许不只在于技术本身,更在于它展示了一种健康的开源项目演进方式。VLA 与 state 的分离、客户端与服务端职责的划分,都不是作者凭空设计的,而是对社区批评的直接回应。
在 VLA 研究快速升温的当下,评测基准的可信度变得愈发重要。一个基准如果观测空间不清晰、评分可被操纵,那么它产出的排名就失去了参考价值。VSArena 主动收紧规则、显式区分赛道、把评分搬到服务端的做法,虽然让项目上线的门槛更高,却也为它日后的公信力打下了基础。
对于关注具身智能与 VLA 模型的开发者来说,这样一个强调「纯感知、防作弊、可复现」的开源基准,值得持续跟进。
相关推荐

@ai-sdk/zai@3.0.10 发布:依赖更新的补丁版本解析
Vercel AI SDK 发布 @ai-sdk/zai@3.0.10 补丁版本,同步更新 provider、provider-utils 与 openai-compatible 等底层依赖。本文解析该版本变更内容及 AI SDK provider 体系的设计意义。

Vercel AI SDK 更新:@ai-sdk/workflow 2.0.29 修复工具结果保留问题
Vercel AI SDK 发布 @ai-sdk/workflow 2.0.29 补丁版本,核心修复工作流在终止、延迟、暂停三种响应状态下 provider 工具执行结果的保留问题,并同步升级 ai@7.0.98 等核心依赖。

Vercel AI SDK 更新:@ai-sdk/xai 4.0.58 批处理与图像生成改进
Vercel AI SDK 发布 @ai-sdk/xai 4.0.58 版本更新,新增批处理图像生成支持,修复批处理请求类型校验及 DeepSeek 推理流问题,并同步升级 provider 相关依赖。