HellaSwag
HellaSwag是一种早期NLP评测基准,主要考察模型的语言理解与常识推理能力,通过句子补全任务评估模型对语义连贯性的理解。
核心事实
时间轴 (近 90 天)
研究从Dolly-15k、LMSYS-Chat-1M、WildChat-1M、MMLU、GSM8K和HellaSwag六个数据源采样了1242条纯英文Prompt
研究覆盖了ARC、GSM8K、HellaSwag、MMLU四大基准测试
早期评测基准如MMLU、HellaSwag已暴露出数据污染和饱和效应等问题
许多经典基准已趋于饱和(如HellaSwag上多个模型得分超过95%),业界正在开发更具区分度的新基准如GPQA、SWE-bench、LiveBench
MMLU评估模型在57个学科领域的知识广度,HumanEval测量代码生成正确率,GSM8K考察数学推理,HELM构建综合多维评估框架
标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)
全部知识事实 (6)
标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)
70%待验证研究从Dolly-15k、LMSYS-Chat-1M、WildChat-1M、MMLU、GSM8K和HellaSwag六个数据源采样了1242条纯英文Prompt
50%待验证研究覆盖了ARC、GSM8K、HellaSwag、MMLU四大基准测试
50%待验证早期评测基准如MMLU、HellaSwag已暴露出数据污染和饱和效应等问题
50%待验证许多经典基准已趋于饱和(如HellaSwag上多个模型得分超过95%),业界正在开发更具区分度的新基准如GPQA、SWE-bench、LiveBench
50%待验证MMLU评估模型在57个学科领域的知识广度,HumanEval测量代码生成正确率,GSM8K考察数学推理,HELM构建综合多维评估框架
50%