[控场AI]
基准

LM Arena

LM Arena是一个面向大语言模型的开放评测平台,由UC Berkeley等机构维护。其核心机制采用人类偏好投票(Elo评分体系),通过让用户对不同模型的匿名回答进行盲测对比,汇聚大规模真实用户评价以生成模型排行榜。平台涵盖文本、代码、图像等多模态评测维度,是学术界和工业界广泛参考的模型能力综合基准之一。

核心事实

来源文章