TranSGrid
以网格世界为载体的系统性泛化评测平台,将演绎、归纳、溯因三种推理形式整合进同一任务,用于全面评估AI模型在系统性泛化上的能力
时间轴 (近 90 天)
一篇发表于arXiv(编号2609.19212v1)的研究提出了名为TranSGrid的新测试平台
TranSGrid的设计理念是将演绎、归纳、溯因三种推理形式整合进同一个统一任务中
研究团队在4,800个TranSGrid实例上测试了七个Transformer模型
所有测试模型在TranSGrid上的表现都远差于常规的留出测试集
表现最好的最大模型能解决79.6%的留出测试集问题,但在TranSGrid上只能解决55.3%,在最难子集上骤降至15.8%
TranSGrid上的性能鸿沟出现在训练长度范围之内,说明仅凭生产力不足以评估系统性泛化
TranSGrid的任务形式以网格世界为载体,模型需要在二维网格环境中理解状态转换规则并推断正确动作序列
对照实验中让目标变为动作显式减少了溯因需求,同样使解题率回到普通测试集水平
任何一种简化单独存在都足以把TranSGrid降格为一个普通的留出测试集
全部知识事实 (9)
任何一种简化单独存在都足以把TranSGrid降格为一个普通的留出测试集
50%待验证TranSGrid的设计理念是将演绎、归纳、溯因三种推理形式整合进同一个统一任务中
50%待验证研究团队在4,800个TranSGrid实例上测试了七个Transformer模型
50%待验证所有测试模型在TranSGrid上的表现都远差于常规的留出测试集
50%待验证表现最好的最大模型能解决79.6%的留出测试集问题,但在TranSGrid上只能解决55.3%,在最难子集上骤降至15.8%
50%待验证TranSGrid上的性能鸿沟出现在训练长度范围之内,说明仅凭生产力不足以评估系统性泛化
50%待验证TranSGrid的任务形式以网格世界为载体,模型需要在二维网格环境中理解状态转换规则并推断正确动作序列
50%待验证对照实验中让目标变为动作显式减少了溯因需求,同样使解题率回到普通测试集水平
50%待验证一篇发表于arXiv(编号2609.19212v1)的研究提出了名为TranSGrid的新测试平台
50%