[控场AI]
基准BIG-Bench / Beyond the Imitation Game Benchmark

BIG-Bench

谷歌于2022年发布的大规模语言模型评测基准,系统记录了多种涌现现象,涵盖数百个任务,用于衡量大语言模型在多样化任务上的能力表现

时间轴 (近 90 天)

10月2日

基准饱和现象:ImageNet 被攻克后催生 ObjectNet、ImageNet-A,GLUE 饱和后出现 SuperGLUE,再后出现 BIG-Bench 和 BIG-Bench Hard

待验证50%
9月23日

由模型发布方主导制定基准是当前大模型领域的普遍现象,类似情况出现在OpenAI的SimpleQA、Google的BIG-Bench等评测中

待验证50%
9月21日

HumanEval 系列专注于代码能力追踪,BIG-Bench 是学术界的评估项目

待验证50%
9月21日

学界通常依赖GLUE、SuperGLUE、BIG-Bench等由独立机构维护的标准化评测集横向比较模型性能

待验证50%
9月17日

2022年谷歌发布的BIG-Bench评测系统记录了多种涌现现象,引发广泛讨论

待验证50%
9月16日

MMLU、HellaSwag、BIG-Bench等主流大语言模型评测体系主要衡量知识覆盖度、逻辑推理与语言流畅性,其设计假设存在可验证的正确答案

待验证50%

全部知识事实 (6)

来源文章