LMARENA(原名Chatbot Arena)是一个用于评估和比较大型语言模型能力的开放式基准测试平台。其核心机制采用人类偏好投票方式,通过让用户在匿名条件下对两个模型的输出进行盲测比较,基于大量真实用户评价汇总生成模型排行榜。该平台以众包评估、动态更新和覆盖多语言多任务场景为主要特征,被广泛用于学术界和工业界的模型性能对比参考。