[控场AI]
基准Chatbot Arena

LMSYS Chatbot Arena

基于人类偏好投票的大模型评测平台,用户通过盲测对比两个模型的回复质量进行投票,结果以Elo评分呈现

核心事实

时间轴 (近 90 天)

9月12日

社区中较受认可的公开评测框架包括LMSYS Chatbot Arena、EleutherAI的LM Evaluation Harness以及HuggingFace Open LLM Leaderboard

待验证50%
9月7日

LMSYS Chatbot Arena是由UC Berkeley主导的评测平台,采用类似国际象棋的Elo评分制,让真实用户在不知道模型身份的情况下进行两两对比投票

待验证50%
9月5日

根据LMSYS Chatbot Arena的经验,需要积累数万次有效投票才能使排名前列模型之间的分数差异达到统计显著性

待验证50%
9月3日

LMSYS Chatbot Arena是由UC Berkeley LMSYS团队运营的大模型众包评测平台,用户匿名向两个模型提问并投票,系统根据胜负结果用ELO评分体系排名

待验证50%
9月1日

伯克利主导的开源项目包括Caffe深度学习框架、Ray分布式计算框架以及大语言模型项目Vicuna和LMSYS Chatbot Arena

待验证50%
7月22日

2024年Chatbot Arena已累积超过100万次人类偏好投票

待验证50%
7月18日

Chatbot Arena通过人类盲测投票评估对话质量,其Elo评分体系截至2024年已积累超过百万次人类投票

待验证60%
7月2日

SGLang 来自 Berkeley 的 LMSYS 团队,该团队同时维护着 Chatbot Arena 大模型评测平台

待验证50%
7月2日

Chatbot Arena is maintained by UC Berkeley's LMSYS team and uses ELO ratings based on large-scale blind human voting to compare AI models.

已验证70%

全部知识事实 (10)

来源文章