基准
LM Arena
LM Arena是一个面向大语言模型的开放评测平台,由UC Berkeley等机构维护。其核心机制采用人类偏好投票(Elo评分体系),通过让用户对不同模型的匿名回答进行盲测对比,汇聚大规模真实用户评价以生成模型排行榜。平台涵盖文本、代码、图像等多模态评测维度,是学术界和工业界广泛参考的模型能力综合基准之一。
核心事实
时间轴 (近 90 天)
6月2日
Composer的基准测试数据是内部闭源基准,未与Claude、GPT-5或Gemini直接对比,也未出现在LM Arena或SWE-Bench等外部基准上
待验证60%
6月1日
在LM Arena的体素(Voxel)生成测试中,7次随机匹配有6次抽到了新版本的Gemini Flash
待验证70%
6月1日
Google在LM Arena中保留了Gemini 3 Flash的model slug不变,但模型输出质量出现了显著提升
待验证80%
6月1日
OpenAI最新图像生成模型GPT Image 2在LM Arena开启了灰度测试
待验证75%
5月31日
LM Arena(原Chatbot Arena)由UC Berkeley LMSYS团队维护,采用Elo评分体系通过用户盲测对比投票衡量模型能力
已验证70%
5月31日
Composer 的基准测试是内部闭源的,尚未出现在 LM Arena 或 SWE-Bench 等外部权威基准测试中
已过期100%
5月31日
LM Arena(原 Chatbot Arena)是由加州大学伯克利分校团队开发的大模型匿名对战评测平台
已验证70%
5月31日
Gemini 2.0 Pro 在 LM Arena 竞技场的各项 Benchmark 中均拿下了排名第一的成绩
已过期75%
5月31日
LM Arena 通过 Elo 评分体系(源自国际象棋排名算法)计算各模型的综合排名
已验证65%