Stickblade Arena:让大模型在物理竞技场里对决的新基准

为什么需要一个「会打架」的LLM基准
评估大模型的推理能力一直是个难题。目前主流的「推理」基准存在两大顽疾:一是静态问题集,其答案往往早已泄漏进训练数据,模型可能只是「背」出了正确答案;二是采用「LLM-as-judge」(用大模型当裁判)的方式,但研究反复表明,这种方法衡量的更多是模型间的相似度,而非模型的真实质量——裁判模型倾向于给和自己风格相近的答案打高分。
LLM-as-judge 方法最早在 MT-Bench 和 Chatbot Arena 中被大规模采用,其核心思路是让一个强大的语言模型(通常是GPT-4)对其他模型的输出进行质量评分。然而,多项研究(如2023年的「Judging LLM-as-a-Judge」论文)揭示了系统性偏差:裁判模型倾向于偏好更长的回答(长度偏差)、与自身生成风格相似的回答(自我偏好偏差)、以及列表中位置靠前的回答(位置偏差)。更根本的问题是,当裁判模型本身对某个推理问题理解不足时,它无法可靠地评估其他模型的推理质量,这使得该方法在衡量前沿推理能力时存在天花板。值得补充的是,即使采用多裁判投票、交换位置等缓解策略,这些偏差也只能被部分减轻而非消除——因为偏差的根源在于语言模型的生成分布本身,而非评估协议的表层设计。
一位开发者(Reddit用户 Cometbuster4969)为此构建了一个另辟蹊径的基准:Stickblade Arena。它的核心思路是把两个大模型化身为2D物理竞技场里的对战角色,让推理能力在真实的物理碰撞中接受考验。

Stickblade Arena的设计原理:物理引擎中的博弈
世界状态与动作循环机制
Stickblade Arena 基于 pymunk 物理引擎构建。pymunk 是基于 Chipmunk2D 物理库的 Python 封装,专门用于2D刚体物理模拟,支持碰撞检测、重力模拟、摩擦力计算、关节约束等功能。与简单的规则引擎不同,pymunk 中的每一次碰撞都经过真实的动量守恒和能量传递计算,这意味着角色的移动轨迹、武器的挥击弧线、以及碰撞后的反弹效果都是由底层物理方程驱动的,而非预设的动画或查表结果。
从技术实现角度看,pymunk 采用分离轴定理(SAT)进行碰撞检测,通过GJK算法计算物体间的最近点距离,再用顺序脉冲法(Sequential Impulse)求解接触约束。这意味着在Stickblade Arena中,当一把剑挥向对手时,引擎会精确计算剑的多边形碰撞体与对手身体碰撞体之间的接触点、法向量和穿透深度,然后基于动量守恒和恢复系数计算碰撞后的速度变化。这种物理精度确保了每一次攻击结果都是可解释的、可追溯的物理事件,而非黑箱判定。
每一回合,参战的两个LLM都会收到一份JSON格式的世界状态,其中包含极其丰富的信息:
- 血量(HP)与双方位置
- 武器几何形状与冷却时间(cooldowns)
- 上一回合受到的伤害
- 剩余弹药
- 竞技场中的危险区域(hazards)
向LLM提供JSON格式的世界状态,本质上是将连续的物理世界离散化为符号表示。这种设计面临一个根本性张力:物理世界是连续的、并行的,而语言模型的输入是离散的、序列化的。模型必须从扁平的数值坐标中重建出空间关系——比如从(x1,y1)和(x2,y2)推断出距离和方向——这是一种从符号到几何的「逆向工程」。认知科学研究表明,人类的空间推理依赖专门的视觉空间工作记忆系统,而LLM只能通过语言中介来模拟这一过程,这从根本上解释了为什么空间推理是LLM的弱项。
模型据此返回一个JSON格式的动作指令。关键在于,所有动作都经由物理引擎结算。举例来说,如果一次挥击落空了,那是因为对手真的通过冲刺(dash)躲开了——这是一次真实的物理层面的「未命中」,而不是某种规则查表的结果。对局在KO、到达时限时的血量领先,或平局时结束。
这种设计的巧妙之处在于:答案无法被预先记忆。每一场对决都是动态生成的、依赖空间推理与实时决策的全新局面,从根本上规避了训练数据泄漏的问题。这里的空间推理要求模型理解2D坐标系中的距离、方向、运动轨迹预测等几何关系——这是当前LLM的已知短板,因为语言模型的训练数据以文本为主,对连续空间中的物理直觉缺乏系统性训练。而部分可观测的环境(模型可能无法看到对手的全部意图或隐藏状态)则进一步增加了决策的复杂度,要求模型在不确定性下做出合理推断。
从博弈论的视角来看,这种部分可观测环境对应的是不完全信息博弈(game of imperfect information)。与完全信息博弈(如国际象棋)不同,参与者无法观察到对手的全部状态或意图。形式化地说,这类问题可以用部分可观测随机博弈(POSG)或部分可观测马尔可夫决策过程的多智能体扩展(Dec-POMDP)来建模。在这类环境中,最优策略通常不是确定性的,而是混合策略——即以某种概率分布在多个动作间随机选择——以避免被对手预测。这要求LLM不仅能推理当前观测,还需要维护对对手隐藏状态的信念(belief),并基于这种不确定信念做出决策。
双轨评估体系:盲测投票与客观榜单
遮蔽身份的人类投票
评估环节同样经过精心设计。人类评审观看对战回放时,双方模型的身份是被遮蔽的。评审只需投票选出哪一方「打得更聪明」。更重要的一个细节是:投票会在身份揭晓之前就完成Elo更新,因此投票不会被模型的名气或声誉所污染——你不会因为知道这是GPT就下意识给它加分。
客观数据榜单
与人类投票并行的,是一套完全客观的数据榜单,记录着:
- 胜/负/平局
- 平均造成的伤害
- 命中数 / 尝试攻击数
- 超时次数(timeouts)
这套双轨制让「主观感受」与「客观表现」得以交叉验证,也为后续分析埋下了伏笔。
六轴Elo评级:不同物理约束考验不同推理能力
Stickblade Arena 最具研究价值的设计,是它的六轴Elo评级系统。评级的主键并非简单的「模型」,而是一个六元组:
(模型, 利刃区域是否开启, 武器, 模式, 竞技场, 是否盲测)
Elo 评级系统最初由物理学家 Arpad Elo 为国际象棋设计,其核心思想是通过对局结果动态更新选手的评分。每位选手有一个数值评分,两人对局前根据评分差计算预期胜率,对局后根据实际结果与预期的偏差来调整双方评分——爆冷获胜会获得更多分数,而输给弱者则会扣除更多分数。
具体的数学公式为:评分差为D时高分方的预期胜率 E = 1/(1+10^(-D/400)),每场对局后的评分更新为 R_new = R_old + K×(S - E),其中S是实际结果(赢=1,平=0.5,负=0),K是决定更新幅度的系数。在AI评估领域,Chatbot Arena 率先将 Elo 引入LLM排名,通过众包投票对模型进行成对比较。然而,Elo系统的一个关键假设是传递性——如果A胜B,B胜C,则A应该胜C。但在LLM对战中,这种传递性可能不成立:模型A的策略可能恰好克制B,B克制C,但C反而克制A,形成类似「石头剪刀布」的非传递关系。这种情况下,标准Elo可能无法准确反映模型的真实实力分布,而更高级的排名方法(如Bradley-Terry模型的多维扩展或TrueSkill)可能更为适用。
聚合后的总Elo只是各维度的边际化(marginalization)结果,而作者真正研究的是每个维度上的独立评级。边际化是概率论中的基本操作,指从联合分布中通过对某些变量求和或积分来获得边缘分布。在六轴 Elo 的语境下,每个模型在(利刃区域、武器、模式、竞技场、盲测状态)这五个条件维度上都有不同的表现,总 Elo 是将这些条件维度「积分掉」后得到的综合评分。这种处理的风险在于:如果不同维度上的对局样本量严重不均衡,或者某些维度组合从未被测试过,边际化结果可能产生误导。
其背后的假设颇具洞察力:不同的物理约束会分别考验不同的推理技能——空间规划能力、部分可观测环境下的不确定性处理能力、以及资源管理能力。
换言之,一个模型可能擅长近战肉搏的空间博弈,却在需要「隐忍等待」的远程武器对决中表现平平。单一的综合分数会掩盖这些细粒度的能力差异。
关键发现:脚本机器人击败了三成LLM
基准线为何至关重要
本次基准的参赛阵容共24个条目:17个来自 OpenAI、Groq、OpenRouter 免费层的LLM,外加4个非LLM基准线(随机策略、贪婪攻击、保持距离、脚本启发式)和2个模拟策略。作者特别强调,基准线至关重要——没有它们,一个低Elo的LLM将无法与一个「随便有多烂」的策略区分开来。
三个值得关注的实验数据
在 n=443 场对局、106 次投票(终身投票转化率23.9%)的数据下,几个发现颇具启发性:
-
人类投票Elo与客观胜率的相关性:跨武器的 Spearman 秩相关系数约为 ρ≈0.71。Spearman 秩相关系数衡量的是两个变量之间的单调关系强度,取值范围为-1到1。与 Pearson 相关系数不同,它不要求变量间存在线性关系,而是基于排名来计算。ρ≈0.71 意味着人类投票排名与客观胜率排名之间存在较强的正相关,但远非完美一致——这说明人类的「聪明」直觉与客观数据大体一致,但仍有相当空间存在偏差。在106次投票的样本量下,这个相关系数的置信区间仍然较宽,说明结论虽然具有统计学意义,但精确度仍需更多数据来提升。
-
弓箭类武器分歧最大:人类会奖励那些「聪明的等待」行为,而这种策略在原始伤害数据上根本体现不出来。这恰恰揭示了纯客观指标的盲区——在需要耐心和时机把握的远程武器对决中,「不攻击」有时是最优策略,但伤害统计只能看到零输出。
-
脚本机器人的碾压:一个仅100行代码的脚本启发式机器人(bot:pro),在客观榜单上击败了约30%的LLM阵容,在主观感知上也击败了约10%。作者直言:「这个差距,基本上就是这个基准的信号所在。」
这个结论相当尖锐——如果一个简单脚本能打败三成的大模型,那么这些模型在实时空间推理与决策上的能力,或许远不如它们在静态推理榜单上的成绩所暗示的那样强大。100行脚本启发式机器人的优势在于:零延迟(不需要token生成时间)、完美的数值计算(精确的距离和角度计算)、以及稳定的执行(不会因为prompt理解偏差而产生无效动作)。相比之下,LLM在这类任务中面临多重瓶颈:首先是数值推理精度问题——研究表明LLM在多步算术和几何计算中的错误率显著高于简单代码;其次是动作空间理解问题——模型可能生成格式错误或物理上不可行的动作;最后是时间压力——如果存在响应时间限制,模型的推理深度会受到约束。这些因素共同解释了为何看似简单的规则系统能在实时对抗中超越更「智能」的系统。
可复现性与已知局限
作者对项目的透明度和局限性保持了坦诚。完整的对局日志可通过 /api/export 导出为 JSON/JSONL 格式,每场对局的提示词版本都被固定记录。由于物理引擎存在RNG碰撞,系统是非确定性的,但随机种子会被记录,基于相同种子的确定性回放已在路线图上。
公开的局限包括:
- 投票人群是自选的(网站访客),并非经过校准的专业评审团
- 机器人基准线并非策略最优(尚无经过强化学习训练的基准)
- HuggingFace 数据集快照的定时任务尚未上线,「冻结评估包」目前无法在平台外复现
结语:一种反训练泄漏的LLM评估新思路
Stickblade Arena 的意义,不在于它现在的具体排名,而在于它提供了一种物理接地(physics-grounded)的评估范式。当推理必须在动态、部分可观测、有物理后果的环境中展开时,模型无处「背答案」,也没有相似的裁判为其站台。
这种评估范式与近年来AI研究中「具身智能」(Embodied AI)的趋势相呼应——越来越多的研究者认为,真正的智能不能脱离物理世界的约束而存在。这一核心主张源自哲学家梅洛-庞蒂和认知科学家Rodney Brooks的思想:智能不是纯粹的符号操作,而是在与物理环境的交互中涌现的。这一观点在AI领域催生了从ALFRED、Habitat到MineDojo等一系列具身评估基准。Stickblade Arena可以被视为这一谱系中的轻量级成员——它虽然没有3D渲染或真实机器人,但保留了具身评估的核心特征:动作有物理后果、环境是动态变化的、评估结果不可提前预测。
值得注意的是,与OpenAI Five(Dota2)或DeepMind的AlphaStar(星际争霸)等先例不同,Stickblade Arena评估的是模型的零样本推理能力,而非经过数百万局强化学习后的特化能力。那些系统证明了AI可以在复杂游戏中达到超人水平,但需要海量的环境交互训练;而Stickblade Arena关注的问题是:一个通用语言模型,仅凭其预训练知识和推理能力,能否在从未见过的物理对抗环境中做出合理决策?这使其作为通用推理基准更具说服力,也更能反映LLM的泛化能力边界。
作者目前最希望获得反馈的两点,也正是这套设计的关键争议:其一是六轴Elo的边际化处理是否合理;其二是「揭晓身份作为奖励」的投票激励机制,是否会引入投票偏差。这两个问题触及了任何众包评估系统的核心难题,值得整个社区深入讨论。
项目地址:https://stickblade-arena.vercel.app 代码仓库:https://github.com/Cometbuster4969/STICKBLADE-ARENA
相关推荐

Lovable Pro Plus 管理面板营销分析:免费积分噱头与风险提示
针对 YouTube 上「Lovable Pro Plus 管理面板、无限免费积分、899 卢比终身访问」的营销素材进行拆解,分析其卖点、Lovable 官方积分机制及潜在的账号与资金风险,并给出理性选择 AI 建站工具的建议。

Dify从0到1实战:搭建20+AI应用的完整教程指南
Dify从0到1实战教程:涵盖Docker部署、MySQL配置、聊天助手、Agent智能体、Chatflow与Workflow工作流五大应用类型,以及大模型接入和应用发布,手把手带你搭建20+AI应用。

IrisGo:演示一次即可自动运行的AI工作流助手
IrisGo 是一款面向独立创业者的 AI 工作流自动化工具,凭借 Watch & Learn 功能实现"演示一次即可自动运行",提供每日简报、邮件分拣和待办跟踪,beta 期免费。本文解析其核心功能与适用场景。