LM Arena是一个面向大语言模型的开放评测平台,由UC Berkeley等机构维护。其核心机制采用人类偏好投票(Elo评分体系),通过让用户对不同模型的匿名回答进行盲测对比,汇聚大规模真实用户评价以生成模型排行榜。平台涵盖文本、代码、图像等多模态评测维度,是学术界和工业界广泛参考的模型能力综合基准之一。
Composer的基准测试数据是内部闭源基准,未与Claude、GPT-5或Gemini直接对比,也未出现在LM Arena或SWE-Bench等外部基准上
在LM Arena的体素(Voxel)生成测试中,7次随机匹配有6次抽到了新版本的Gemini Flash
Google在LM Arena中保留了Gemini 3 Flash的model slug不变,但模型输出质量出现了显著提升
OpenAI最新图像生成模型GPT Image 2在LM Arena开启了灰度测试
LM Arena(原Chatbot Arena)由UC Berkeley LMSYS团队维护,采用Elo评分体系通过用户盲测对比投票衡量模型能力
Composer 的基准测试是内部闭源的,尚未出现在 LM Arena 或 SWE-Bench 等外部权威基准测试中
LM Arena(原 Chatbot Arena)是由加州大学伯克利分校团队开发的大模型匿名对战评测平台
Gemini 2.0 Pro 在 LM Arena 竞技场的各项 Benchmark 中均拿下了排名第一的成绩
LM Arena 通过 Elo 评分体系(源自国际象棋排名算法)计算各模型的综合排名