LMSYS Chatbot Arena
基于人类偏好投票的大模型评测平台,用户通过盲测对比两个模型的回复质量进行投票,结果以Elo评分呈现
Core Facts
Timeline (last 90 days)
LMSYS Chatbot Arena是由UC Berkeley主导的评测平台,采用类似国际象棋的Elo评分制,让真实用户在不知道模型身份的情况下进行两两对比投票
根据LMSYS Chatbot Arena的经验,需要积累数万次有效投票才能使排名前列模型之间的分数差异达到统计显著性
LMSYS Chatbot Arena是由UC Berkeley LMSYS团队运营的大模型众包评测平台,用户匿名向两个模型提问并投票,系统根据胜负结果用ELO评分体系排名
伯克利主导的开源项目包括Caffe深度学习框架、Ray分布式计算框架以及大语言模型项目Vicuna和LMSYS Chatbot Arena
2024年Chatbot Arena已累积超过100万次人类偏好投票
SGLang 来自 Berkeley 的 LMSYS 团队,该团队同时维护着 Chatbot Arena 大模型评测平台
Chatbot Arena is maintained by UC Berkeley's LMSYS team and uses ELO ratings based on large-scale blind human voting to compare AI models.
All Facts (8)
Chatbot Arena is maintained by UC Berkeley's LMSYS team and uses ELO ratings based on large-scale blind human voting to compare AI models.
70%VerifiedLMSys Chatbot Arena由UC Berkeley的LMSYS组织创建,自2023年上线以来已收集超过百万次人类投票
65%UnverifiedLMSYS Chatbot Arena是由UC Berkeley主导的评测平台,采用类似国际象棋的Elo评分制,让真实用户在不知道模型身份的情况下进行两两对比投票
50%Unverified根据LMSYS Chatbot Arena的经验,需要积累数万次有效投票才能使排名前列模型之间的分数差异达到统计显著性
50%UnverifiedLMSYS Chatbot Arena是由UC Berkeley LMSYS团队运营的大模型众包评测平台,用户匿名向两个模型提问并投票,系统根据胜负结果用ELO评分体系排名
50%Unverified伯克利主导的开源项目包括Caffe深度学习框架、Ray分布式计算框架以及大语言模型项目Vicuna和LMSYS Chatbot Arena
50%Unverified2024年Chatbot Arena已累积超过100万次人类偏好投票
50%UnverifiedSGLang 来自 Berkeley 的 LMSYS 团队,该团队同时维护着 Chatbot Arena 大模型评测平台
50%