[控场AI]
基准BIG-Bench Hard / BIG-Bench

BBH

从BIG-Bench中筛选出主流模型表现显著低于随机基线的23项任务组成的评测基准,专门考察逻辑推理、符号操作等难以通过数据记忆解决的能力

时间轴 (近 90 天)

10月6日

在全部 38 项基准中,Aplomb 1 在 8 项上拿到 5.3B 以内模型最高分,包括 MMLU-Pro、GPQA Diamond 和 BBH

待验证50%

全部知识事实 (1)

来源文章