BIG-Bench
谷歌于2022年发布的大规模语言模型评测基准,系统记录了多种涌现现象,涵盖数百个任务,用于衡量大语言模型在多样化任务上的能力表现
时间轴 (近 90 天)
基准饱和现象:ImageNet 被攻克后催生 ObjectNet、ImageNet-A,GLUE 饱和后出现 SuperGLUE,再后出现 BIG-Bench 和 BIG-Bench Hard
由模型发布方主导制定基准是当前大模型领域的普遍现象,类似情况出现在OpenAI的SimpleQA、Google的BIG-Bench等评测中
HumanEval 系列专注于代码能力追踪,BIG-Bench 是学术界的评估项目
学界通常依赖GLUE、SuperGLUE、BIG-Bench等由独立机构维护的标准化评测集横向比较模型性能
2022年谷歌发布的BIG-Bench评测系统记录了多种涌现现象,引发广泛讨论
MMLU、HellaSwag、BIG-Bench等主流大语言模型评测体系主要衡量知识覆盖度、逻辑推理与语言流畅性,其设计假设存在可验证的正确答案
全部知识事实 (6)
基准饱和现象:ImageNet 被攻克后催生 ObjectNet、ImageNet-A,GLUE 饱和后出现 SuperGLUE,再后出现 BIG-Bench 和 BIG-Bench Hard
50%待验证由模型发布方主导制定基准是当前大模型领域的普遍现象,类似情况出现在OpenAI的SimpleQA、Google的BIG-Bench等评测中
50%待验证HumanEval 系列专注于代码能力追踪,BIG-Bench 是学术界的评估项目
50%待验证学界通常依赖GLUE、SuperGLUE、BIG-Bench等由独立机构维护的标准化评测集横向比较模型性能
50%待验证2022年谷歌发布的BIG-Bench评测系统记录了多种涌现现象,引发广泛讨论
50%待验证MMLU、HellaSwag、BIG-Bench等主流大语言模型评测体系主要衡量知识覆盖度、逻辑推理与语言流畅性,其设计假设存在可验证的正确答案
50%