LMSYS
UC Berkeley旗下的大型模型系统研究团队,以推出Chatbot Arena多模型评测平台著称,积累了大量人类偏好数据
核心事实
时间轴 (近 90 天)
Chatbot Arena(LMSYS)通过大量人类盲测对比部分弥补了LLM-as-a-judge的偏差缺陷,但其成本使其难以成为开发者日常工作流的一部分
Chatbot Arena(LMSYS)采用真实用户盲测投票,让两个匿名模型回答同一问题,结果以ELO积分呈现
Chatbot Arena是由LMSYS运营的基于众包的实时评测平台,用户同时与两个匿名模型对话并投票选出更好的一方
用户在Chatbot Arena中的投票可能受到回答风格、Markdown格式偏好等非能力因素的影响,LMSYS引入控制变量分析和Bootstrap置信区间估计来提高排名可靠性
SGLang由LMSYS开发,专注于结构化输出和复杂工作流,引入了RadixAttention机制,能自动检测并复用prompt的公共前缀
LLM-as-a-Judge方法最初由LMSYS在其Chatbot Arena中推广
Scale AI的SEAL排行榜和LMSYS的Chatbot Arena采用封闭评估策略,其中Chatbot Arena通过真实用户盲测投票的Elo评分机制评估模型
LLM-as-a-Judge评估范式最早由LMSYS团队在MT-Bench和Chatbot Arena中大规模应用
Elo系统假设能力是一维标量,无法反映模型在不同任务维度上的差异化表现,LMSYS后续引入了分类别排名机制来弥补这一不足
LMSYS团队要求每个模型至少积累数千次对比投票才认为其Elo评分具有统计显著性,并会公布95%置信区间
还有 12 条时间轴事件
全部知识事实 (20)
LMSYS运营的Chatbot Arena通过真实用户对匿名模型盲评投票,采用源自国际象棋的ELO评分体系排名
85%已验证Chatbot Arena是由LMSYS运营的基于众包的实时评测平台,用户同时与两个匿名模型对话并投票选出更好的一方
75%已验证Arena(Chatbot Arena)是由加州大学伯克利分校LMSYS团队创建的AI模型评测平台,采用盲测对战机制生成ELO积分排行榜
75%已验证LMSys Chatbot Arena由UC Berkeley的LMSYS组织创建,自2023年上线以来已收集超过百万次人类投票
75%已验证LM Arena(原Chatbot Arena)由UC Berkeley LMSYS团队维护,采用Elo评分体系通过用户盲测对比投票衡量模型能力
70%已验证Chatbot Arena由LMSYS Org维护,采用ELO评分体系
65%待验证Chatbot Arena was introduced by a research team at UC Berkeley in 2023 and is one of the earliest platforms to implement large-scale LLM battle evaluation
90%待验证WebDev Arena借鉴Chatbot Arena的人类偏好投票机制,通过盲测投票并以ELO积分排名
70%待验证Arena类平台采用成对盲测机制,用户在不知道模型身份的情况下投票选出更好的回答
60%待验证Web Dev Arena是由LMSYS推出的专项评测平台,采用盲测对战机制,用户凭视觉效果投票,通过Elo评分体系排名
60%待验证Chatbot Arena(LMSYS)通过大量人类盲测对比部分弥补了LLM-as-a-judge的偏差缺陷,但其成本使其难以成为开发者日常工作流的一部分
50%待验证Chatbot Arena(LMSYS)采用真实用户盲测投票,让两个匿名模型回答同一问题,结果以ELO积分呈现
50%待验证用户在Chatbot Arena中的投票可能受到回答风格、Markdown格式偏好等非能力因素的影响,LMSYS引入控制变量分析和Bootstrap置信区间估计来提高排名可靠性
50%待验证SGLang由LMSYS开发,专注于结构化输出和复杂工作流,引入了RadixAttention机制,能自动检测并复用prompt的公共前缀
50%待验证LLM-as-a-Judge方法最初由LMSYS在其Chatbot Arena中推广
50%待验证Scale AI的SEAL排行榜和LMSYS的Chatbot Arena采用封闭评估策略,其中Chatbot Arena通过真实用户盲测投票的Elo评分机制评估模型
50%待验证LLM-as-a-Judge评估范式最早由LMSYS团队在MT-Bench和Chatbot Arena中大规模应用
50%待验证Elo系统假设能力是一维标量,无法反映模型在不同任务维度上的差异化表现,LMSYS后续引入了分类别排名机制来弥补这一不足
50%待验证LMSYS团队要求每个模型至少积累数千次对比投票才认为其Elo评分具有统计显著性,并会公布95%置信区间
50%待验证LMSYS团队通常要求每个模型至少积累数千次对比投票才认为其Elo评分具有统计显著性
50%