CARAT
材料科学领域的LLM评测基准,用于区分模型的推理能力与背诵能力,引入GraphSpace结构化表示框架和多种控制机制(答案遮蔽、证据注入、配对推理等)进行严格评估
Timeline (last 90 days)
论文《CARAT: Do Materials LLMs Reason or Recite?》提出了材料科学大语言模型究竟是在推理还是背诵的问题
传统准确率指标无法区分模型是在从结构进行推理还是直接复制输入中已印出的答案
CARAT的方法论核心是控制变量,固定问题和标准答案,在八个经过匹配的视图之间进行对比
CARAT引入GraphSpace作为核心表示框架,将晶体结构的原子位置、键合关系、对称性等信息以结构化图的形式组织
CARAT使用了匹配微调、答案遮蔽、证据注入、配对推理以及允许模型拒绝作答的机制
在最难类别题目上,经过接地处理的视图比单纯喂公式输入高出17.3分
一条跳过关系链接直接读列表的捷径规则能答对七个强化题族中的四个
研究者不断重建基准直到十一条捷径都被压到接近随机猜测水平
被冻结的模型在链接被重定向到别处时,在95.6%的配对案例中给出相同答案,说明模型只是复述关系而非使用它
经过匹配监督训练后模型表现提升到99.8%,而删除关系链接后正确率骤降到23.4%,甚至低于最佳捷径的27.0%
1 more timeline events
All Facts (11)
论文《CARAT: Do Materials LLMs Reason or Recite?》提出了材料科学大语言模型究竟是在推理还是背诵的问题
50%Unverified传统准确率指标无法区分模型是在从结构进行推理还是直接复制输入中已印出的答案
50%UnverifiedCARAT的方法论核心是控制变量,固定问题和标准答案,在八个经过匹配的视图之间进行对比
50%UnverifiedCARAT引入GraphSpace作为核心表示框架,将晶体结构的原子位置、键合关系、对称性等信息以结构化图的形式组织
50%UnverifiedCARAT使用了匹配微调、答案遮蔽、证据注入、配对推理以及允许模型拒绝作答的机制
50%Unverified在最难类别题目上,经过接地处理的视图比单纯喂公式输入高出17.3分
50%Unverified一条跳过关系链接直接读列表的捷径规则能答对七个强化题族中的四个
50%Unverified研究者不断重建基准直到十一条捷径都被压到接近随机猜测水平
50%Unverified被冻结的模型在链接被重定向到别处时,在95.6%的配对案例中给出相同答案,说明模型只是复述关系而非使用它
50%Unverified经过匹配监督训练后模型表现提升到99.8%,而删除关系链接后正确率骤降到23.4%,甚至低于最佳捷径的27.0%
50%UnverifiedLLM评测中高准确率可能是信息泄漏的产物而非真正推理能力,尤其在CIF文件等同时包含多个属性字段的结构化科学数据中突出
50%