[控场AI]
基准

LM Arena

LM Arena是一个面向大语言模型的开放评测平台,由UC Berkeley等机构维护。其核心机制采用人类偏好投票(Elo评分体系),通过让用户对不同模型的匿名回答进行盲测对比,汇聚大规模真实用户评价以生成模型排行榜。平台涵盖文本、代码、图像等多模态评测维度,是学术界和工业界广泛参考的模型能力综合基准之一。

核心事实

时间轴 (近 90 天)

6月2日

Composer的基准测试数据是内部闭源基准,未与Claude、GPT-5或Gemini直接对比,也未出现在LM Arena或SWE-Bench等外部基准上

待验证60%
6月1日

在LM Arena的体素(Voxel)生成测试中,7次随机匹配有6次抽到了新版本的Gemini Flash

待验证70%
6月1日

Google在LM Arena中保留了Gemini 3 Flash的model slug不变,但模型输出质量出现了显著提升

待验证80%
6月1日

OpenAI最新图像生成模型GPT Image 2在LM Arena开启了灰度测试

待验证75%
5月31日

LM Arena(原Chatbot Arena)由UC Berkeley LMSYS团队维护,采用Elo评分体系通过用户盲测对比投票衡量模型能力

已验证70%
5月31日

Composer 的基准测试是内部闭源的,尚未出现在 LM Arena 或 SWE-Bench 等外部权威基准测试中

已过期100%
5月31日

LM Arena(原 Chatbot Arena)是由加州大学伯克利分校团队开发的大模型匿名对战评测平台

已验证70%
5月31日

Gemini 2.0 Pro 在 LM Arena 竞技场的各项 Benchmark 中均拿下了排名第一的成绩

已过期75%
5月31日

LM Arena 通过 Elo 评分体系(源自国际象棋排名算法)计算各模型的综合排名

已验证65%

全部知识事实 (3)

来源文章