基准ARC Challenge / AI2 Reasoning Challenge Challenge子集
ARC-Challenge
艾伦人工智能研究所发布的科学推理基准测试,专门筛选传统检索方法和词共现算法均无法解决的难题,共约1172道多项选择题,强调真正的推理能力
时间轴 (近 90 天)
10月6日
一则Reddit技术分享声称,一个仅0.8B参数的模型在ARC-Challenge基准上取得42.15%的成绩,超过未经微调的Qwen3.5-2B基础模型,并优于使用2.5万条数据进行SFT蒸馏的方案
待验证50%
10月6日
ARC的Challenge子集专门挑选出传统IR系统和词共现模型均答错的题目,共约1172道测试题
待验证50%
10月6日
ARC-Challenge为四选一多项选择题,随机基线为25%
待验证50%
10月6日
GPT-4级别模型在ARC-Challenge测试上可达90%以上,许多7B以上主流模型已能突破70%
待验证50%
10月6日
该声明缺乏完整论文和开源代码支撑,评测设置(0-shot或few-shot)、对比公平性和可复现性等关键问题均无法从原始内容中确认
待验证50%
全部知识事实 (5)
待验证
一则Reddit技术分享声称,一个仅0.8B参数的模型在ARC-Challenge基准上取得42.15%的成绩,超过未经微调的Qwen3.5-2B基础模型,并优于使用2.5万条数据进行SFT蒸馏的方案
50%待验证ARC的Challenge子集专门挑选出传统IR系统和词共现模型均答错的题目,共约1172道测试题
50%待验证ARC-Challenge为四选一多项选择题,随机基线为25%
50%待验证GPT-4级别模型在ARC-Challenge测试上可达90%以上,许多7B以上主流模型已能突破70%
50%待验证该声明缺乏完整论文和开源代码支撑,评测设置(0-shot或few-shot)、对比公平性和可复现性等关键问题均无法从原始内容中确认
50%