[KongchangAI]
Benchmark

HellaSwag

HellaSwag是一种早期NLP评测基准,主要考察模型的语言理解与常识推理能力,通过句子补全任务评估模型对语义连贯性的理解。

Core Facts

Timeline (last 90 days)

Sep 11

研究覆盖了ARC、GSM8K、HellaSwag、MMLU四大基准测试

Unverified50%
Sep 9

早期评测基准如MMLU、HellaSwag已暴露出数据污染和饱和效应等问题

Unverified50%
Sep 3

许多经典基准已趋于饱和(如HellaSwag上多个模型得分超过95%),业界正在开发更具区分度的新基准如GPQA、SWE-bench、LiveBench

Unverified50%
Jul 15

MMLU评估模型在57个学科领域的知识广度,HumanEval测量代码生成正确率,GSM8K考察数学推理,HELM构建综合多维评估框架

Unverified50%
Jul 12

标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)

Verified70%

All Facts (5)

Source Articles