[控场AI]
基准Peerify系统

Peerify

一个面向学术同行评审事实核查的自动化流水线系统,通过原子论断分解、证据检索和判定三步骤验证审稿意见是否有稿件内容支撑,并附带标准化基准数据集

时间轴 (近 90 天)

9月23日

Peerify系统构建了一条面向稿件事实核查的自动化流水线,用于判断每条审稿论断是否能在论文中找到支撑证据

待验证50%
9月23日

Peerify的核心流程分为三步:将评论分解为原子论断、检索相关的稿件证据、判定每条论断是否被论文所支持

待验证50%
9月23日

研究团队构建了一个包含800条论断的基准数据集,用于训练和评估流水线

待验证50%
9月23日

基准数据集中的论断来自NeurIPS 2024和ICLR 2024两个机器学习会议的真实评审互动

待验证50%
9月23日

数据集包含一个300条人工标注的子集,用于审计自动化标注的可靠性

待验证50%
9月23日

审计结果显示自动标签与人类共识在90.3%的论断上保持一致,Cohen's Kappa系数达到0.87

待验证50%
9月23日

Peerify当前方法最大的难点来自模糊的、带解释性的审稿论断,这类论断难以找到明确的支持或反对证据

待验证50%

全部知识事实 (7)

来源文章