LMSYS Chatbot Arena
基于人类偏好投票的大模型评测平台,用户通过盲测对比两个模型的回复质量进行投票,结果以Elo评分呈现
核心事实
时间轴 (近 90 天)
社区中较受认可的公开评测框架包括LMSYS Chatbot Arena、EleutherAI的LM Evaluation Harness以及HuggingFace Open LLM Leaderboard
LMSYS Chatbot Arena是由UC Berkeley主导的评测平台,采用类似国际象棋的Elo评分制,让真实用户在不知道模型身份的情况下进行两两对比投票
根据LMSYS Chatbot Arena的经验,需要积累数万次有效投票才能使排名前列模型之间的分数差异达到统计显著性
LMSYS Chatbot Arena是由UC Berkeley LMSYS团队运营的大模型众包评测平台,用户匿名向两个模型提问并投票,系统根据胜负结果用ELO评分体系排名
伯克利主导的开源项目包括Caffe深度学习框架、Ray分布式计算框架以及大语言模型项目Vicuna和LMSYS Chatbot Arena
2024年Chatbot Arena已累积超过100万次人类偏好投票
Chatbot Arena通过人类盲测投票评估对话质量,其Elo评分体系截至2024年已积累超过百万次人类投票
SGLang 来自 Berkeley 的 LMSYS 团队,该团队同时维护着 Chatbot Arena 大模型评测平台
Chatbot Arena is maintained by UC Berkeley's LMSYS team and uses ELO ratings based on large-scale blind human voting to compare AI models.
全部知识事实 (10)
Chatbot Arena is maintained by UC Berkeley's LMSYS team and uses ELO ratings based on large-scale blind human voting to compare AI models.
70%已验证LMSys Chatbot Arena由UC Berkeley的LMSYS组织创建,自2023年上线以来已收集超过百万次人类投票
65%待验证Chatbot Arena通过人类盲测投票评估对话质量,其Elo评分体系截至2024年已积累超过百万次人类投票
60%待验证社区中较受认可的公开评测框架包括LMSYS Chatbot Arena、EleutherAI的LM Evaluation Harness以及HuggingFace Open LLM Leaderboard
50%待验证LMSYS Chatbot Arena是由UC Berkeley主导的评测平台,采用类似国际象棋的Elo评分制,让真实用户在不知道模型身份的情况下进行两两对比投票
50%待验证根据LMSYS Chatbot Arena的经验,需要积累数万次有效投票才能使排名前列模型之间的分数差异达到统计显著性
50%待验证LMSYS Chatbot Arena是由UC Berkeley LMSYS团队运营的大模型众包评测平台,用户匿名向两个模型提问并投票,系统根据胜负结果用ELO评分体系排名
50%待验证伯克利主导的开源项目包括Caffe深度学习框架、Ray分布式计算框架以及大语言模型项目Vicuna和LMSYS Chatbot Arena
50%待验证2024年Chatbot Arena已累积超过100万次人类偏好投票
50%待验证SGLang 来自 Berkeley 的 LMSYS 团队,该团队同时维护着 Chatbot Arena 大模型评测平台
50%