基准BIG-Bench Hard / BIG-Bench
BBH
从BIG-Bench中筛选出主流模型表现显著低于随机基线的23项任务组成的评测基准,专门考察逻辑推理、符号操作等难以通过数据记忆解决的能力
时间轴 (近 90 天)
10月6日
在全部 38 项基准中,Aplomb 1 在 8 项上拿到 5.3B 以内模型最高分,包括 MMLU-Pro、GPQA Diamond 和 BBH
待验证50%
从BIG-Bench中筛选出主流模型表现显著低于随机基线的23项任务组成的评测基准,专门考察逻辑推理、符号操作等难以通过数据记忆解决的能力
在全部 38 项基准中,Aplomb 1 在 8 项上拿到 5.3B 以内模型最高分,包括 MMLU-Pro、GPQA Diamond 和 BBH