[控场AI]
公司Large Model Systems Organization

LMSYS

UC Berkeley旗下的大型模型系统研究团队,以推出Chatbot Arena多模型评测平台著称,积累了大量人类偏好数据

核心事实

时间轴 (近 90 天)

10月5日

Chatbot Arena(LMSYS)通过大量人类盲测对比部分弥补了LLM-as-a-judge的偏差缺陷,但其成本使其难以成为开发者日常工作流的一部分

待验证50%
9月12日

Chatbot Arena(LMSYS)采用真实用户盲测投票,让两个匿名模型回答同一问题,结果以ELO积分呈现

待验证50%
9月11日

Chatbot Arena是由LMSYS运营的基于众包的实时评测平台,用户同时与两个匿名模型对话并投票选出更好的一方

已验证75%
9月11日

用户在Chatbot Arena中的投票可能受到回答风格、Markdown格式偏好等非能力因素的影响,LMSYS引入控制变量分析和Bootstrap置信区间估计来提高排名可靠性

待验证50%
9月9日

SGLang由LMSYS开发,专注于结构化输出和复杂工作流,引入了RadixAttention机制,能自动检测并复用prompt的公共前缀

待验证50%
9月8日

LLM-as-a-Judge方法最初由LMSYS在其Chatbot Arena中推广

待验证50%
9月8日

Scale AI的SEAL排行榜和LMSYS的Chatbot Arena采用封闭评估策略,其中Chatbot Arena通过真实用户盲测投票的Elo评分机制评估模型

待验证50%
9月7日

LLM-as-a-Judge评估范式最早由LMSYS团队在MT-Bench和Chatbot Arena中大规模应用

待验证50%
9月7日

Elo系统假设能力是一维标量,无法反映模型在不同任务维度上的差异化表现,LMSYS后续引入了分类别排名机制来弥补这一不足

待验证50%
9月6日

LMSYS团队要求每个模型至少积累数千次对比投票才认为其Elo评分具有统计显著性,并会公布95%置信区间

待验证50%

还有 12 条时间轴事件

全部知识事实 (20)

已验证

LMSYS运营的Chatbot Arena通过真实用户对匿名模型盲评投票,采用源自国际象棋的ELO评分体系排名

85%
已验证

Chatbot Arena是由LMSYS运营的基于众包的实时评测平台,用户同时与两个匿名模型对话并投票选出更好的一方

75%
已验证

Arena(Chatbot Arena)是由加州大学伯克利分校LMSYS团队创建的AI模型评测平台,采用盲测对战机制生成ELO积分排行榜

75%
已验证

LMSys Chatbot Arena由UC Berkeley的LMSYS组织创建,自2023年上线以来已收集超过百万次人类投票

75%
已验证

LM Arena(原Chatbot Arena)由UC Berkeley LMSYS团队维护,采用Elo评分体系通过用户盲测对比投票衡量模型能力

70%
已验证

Chatbot Arena由LMSYS Org维护,采用ELO评分体系

65%
待验证

Chatbot Arena was introduced by a research team at UC Berkeley in 2023 and is one of the earliest platforms to implement large-scale LLM battle evaluation

90%
待验证

WebDev Arena借鉴Chatbot Arena的人类偏好投票机制,通过盲测投票并以ELO积分排名

70%
待验证

Arena类平台采用成对盲测机制,用户在不知道模型身份的情况下投票选出更好的回答

60%
待验证

Web Dev Arena是由LMSYS推出的专项评测平台,采用盲测对战机制,用户凭视觉效果投票,通过Elo评分体系排名

60%
待验证

Chatbot Arena(LMSYS)通过大量人类盲测对比部分弥补了LLM-as-a-judge的偏差缺陷,但其成本使其难以成为开发者日常工作流的一部分

50%
待验证

Chatbot Arena(LMSYS)采用真实用户盲测投票,让两个匿名模型回答同一问题,结果以ELO积分呈现

50%
待验证

用户在Chatbot Arena中的投票可能受到回答风格、Markdown格式偏好等非能力因素的影响,LMSYS引入控制变量分析和Bootstrap置信区间估计来提高排名可靠性

50%
待验证

SGLang由LMSYS开发,专注于结构化输出和复杂工作流,引入了RadixAttention机制,能自动检测并复用prompt的公共前缀

50%
待验证

LLM-as-a-Judge方法最初由LMSYS在其Chatbot Arena中推广

50%
待验证

Scale AI的SEAL排行榜和LMSYS的Chatbot Arena采用封闭评估策略,其中Chatbot Arena通过真实用户盲测投票的Elo评分机制评估模型

50%
待验证

LLM-as-a-Judge评估范式最早由LMSYS团队在MT-Bench和Chatbot Arena中大规模应用

50%
待验证

Elo系统假设能力是一维标量,无法反映模型在不同任务维度上的差异化表现,LMSYS后续引入了分类别排名机制来弥补这一不足

50%
待验证

LMSYS团队要求每个模型至少积累数千次对比投票才认为其Elo评分具有统计显著性,并会公布95%置信区间

50%
待验证

LMSYS团队通常要求每个模型至少积累数千次对比投票才认为其Elo评分具有统计显著性

50%

来源文章