[控场AI]
基准

TranSGrid

以网格世界为载体的系统性泛化评测平台,将演绎、归纳、溯因三种推理形式整合进同一任务,用于全面评估AI模型在系统性泛化上的能力

时间轴 (近 90 天)

9月18日

一篇发表于arXiv(编号2609.19212v1)的研究提出了名为TranSGrid的新测试平台

待验证50%
9月18日

TranSGrid的设计理念是将演绎、归纳、溯因三种推理形式整合进同一个统一任务中

待验证50%
9月18日

研究团队在4,800个TranSGrid实例上测试了七个Transformer模型

待验证50%
9月18日

所有测试模型在TranSGrid上的表现都远差于常规的留出测试集

待验证50%
9月18日

表现最好的最大模型能解决79.6%的留出测试集问题,但在TranSGrid上只能解决55.3%,在最难子集上骤降至15.8%

待验证50%
9月18日

TranSGrid上的性能鸿沟出现在训练长度范围之内,说明仅凭生产力不足以评估系统性泛化

待验证50%
9月18日

TranSGrid的任务形式以网格世界为载体,模型需要在二维网格环境中理解状态转换规则并推断正确动作序列

待验证50%
9月18日

对照实验中让目标变为动作显式减少了溯因需求,同样使解题率回到普通测试集水平

待验证50%
9月18日

任何一种简化单独存在都足以把TranSGrid降格为一个普通的留出测试集

待验证50%

全部知识事实 (9)

来源文章