[控场AI]
基准

HellaSwag

HellaSwag是一种早期NLP评测基准,主要考察模型的语言理解与常识推理能力,通过句子补全任务评估模型对语义连贯性的理解。

核心事实

时间轴 (近 90 天)

9月15日

研究从Dolly-15k、LMSYS-Chat-1M、WildChat-1M、MMLU、GSM8K和HellaSwag六个数据源采样了1242条纯英文Prompt

待验证50%
9月11日

研究覆盖了ARC、GSM8K、HellaSwag、MMLU四大基准测试

待验证50%
9月9日

早期评测基准如MMLU、HellaSwag已暴露出数据污染和饱和效应等问题

待验证50%
9月3日

许多经典基准已趋于饱和(如HellaSwag上多个模型得分超过95%),业界正在开发更具区分度的新基准如GPQA、SWE-bench、LiveBench

待验证50%
7月15日

MMLU评估模型在57个学科领域的知识广度,HumanEval测量代码生成正确率,GSM8K考察数学推理,HELM构建综合多维评估框架

待验证50%
7月12日

标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)

已验证70%

全部知识事实 (6)

来源文章