[控场AI]
基准ARC Challenge / AI2 Reasoning Challenge Challenge子集

ARC-Challenge

艾伦人工智能研究所发布的科学推理基准测试,专门筛选传统检索方法和词共现算法均无法解决的难题,共约1172道多项选择题,强调真正的推理能力

时间轴 (近 90 天)

10月6日

一则Reddit技术分享声称,一个仅0.8B参数的模型在ARC-Challenge基准上取得42.15%的成绩,超过未经微调的Qwen3.5-2B基础模型,并优于使用2.5万条数据进行SFT蒸馏的方案

待验证50%
10月6日

ARC的Challenge子集专门挑选出传统IR系统和词共现模型均答错的题目,共约1172道测试题

待验证50%
10月6日

ARC-Challenge为四选一多项选择题,随机基线为25%

待验证50%
10月6日

GPT-4级别模型在ARC-Challenge测试上可达90%以上,许多7B以上主流模型已能突破70%

待验证50%
10月6日

该声明缺乏完整论文和开源代码支撑,评测设置(0-shot或few-shot)、对比公平性和可复现性等关键问题均无法从原始内容中确认

待验证50%

全部知识事实 (5)

来源文章