Benchmark
HellaSwag
HellaSwag是一种早期NLP评测基准,主要考察模型的语言理解与常识推理能力,通过句子补全任务评估模型对语义连贯性的理解。
Core Facts
Timeline (last 90 days)
Sep 11
研究覆盖了ARC、GSM8K、HellaSwag、MMLU四大基准测试
Unverified50%
Sep 9
早期评测基准如MMLU、HellaSwag已暴露出数据污染和饱和效应等问题
Unverified50%
Sep 3
许多经典基准已趋于饱和(如HellaSwag上多个模型得分超过95%),业界正在开发更具区分度的新基准如GPQA、SWE-bench、LiveBench
Unverified50%
Jul 15
MMLU评估模型在57个学科领域的知识广度,HumanEval测量代码生成正确率,GSM8K考察数学推理,HELM构建综合多维评估框架
Unverified50%
Jul 12
标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)
Verified70%
All Facts (5)
Verified
标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)
70%Unverified研究覆盖了ARC、GSM8K、HellaSwag、MMLU四大基准测试
50%Unverified早期评测基准如MMLU、HellaSwag已暴露出数据污染和饱和效应等问题
50%Unverified许多经典基准已趋于饱和(如HellaSwag上多个模型得分超过95%),业界正在开发更具区分度的新基准如GPQA、SWE-bench、LiveBench
50%UnverifiedMMLU评估模型在57个学科领域的知识广度,HumanEval测量代码生成正确率,GSM8K考察数学推理,HELM构建综合多维评估框架
50%