[控场AI]
基准CARAT benchmark

CARAT

材料科学领域的LLM评测基准,用于区分模型的推理能力与背诵能力,引入GraphSpace结构化表示框架和多种控制机制(答案遮蔽、证据注入、配对推理等)进行严格评估

时间轴 (近 90 天)

10月1日

论文《CARAT: Do Materials LLMs Reason or Recite?》提出了材料科学大语言模型究竟是在推理还是背诵的问题

待验证50%
10月1日

传统准确率指标无法区分模型是在从结构进行推理还是直接复制输入中已印出的答案

待验证50%
10月1日

CARAT的方法论核心是控制变量,固定问题和标准答案,在八个经过匹配的视图之间进行对比

待验证50%
10月1日

CARAT引入GraphSpace作为核心表示框架,将晶体结构的原子位置、键合关系、对称性等信息以结构化图的形式组织

待验证50%
10月1日

CARAT使用了匹配微调、答案遮蔽、证据注入、配对推理以及允许模型拒绝作答的机制

待验证50%
10月1日

在最难类别题目上,经过接地处理的视图比单纯喂公式输入高出17.3分

待验证50%
10月1日

一条跳过关系链接直接读列表的捷径规则能答对七个强化题族中的四个

待验证50%
10月1日

研究者不断重建基准直到十一条捷径都被压到接近随机猜测水平

待验证50%
10月1日

被冻结的模型在链接被重定向到别处时,在95.6%的配对案例中给出相同答案,说明模型只是复述关系而非使用它

待验证50%
10月1日

经过匹配监督训练后模型表现提升到99.8%,而删除关系链接后正确率骤降到23.4%,甚至低于最佳捷径的27.0%

待验证50%

还有 1 条时间轴事件

全部知识事实 (11)

来源文章