基准Peerify系统
Peerify
一个面向学术同行评审事实核查的自动化流水线系统,通过原子论断分解、证据检索和判定三步骤验证审稿意见是否有稿件内容支撑,并附带标准化基准数据集
时间轴 (近 90 天)
9月23日
Peerify系统构建了一条面向稿件事实核查的自动化流水线,用于判断每条审稿论断是否能在论文中找到支撑证据
待验证50%
9月23日
Peerify的核心流程分为三步:将评论分解为原子论断、检索相关的稿件证据、判定每条论断是否被论文所支持
待验证50%
9月23日
研究团队构建了一个包含800条论断的基准数据集,用于训练和评估流水线
待验证50%
9月23日
基准数据集中的论断来自NeurIPS 2024和ICLR 2024两个机器学习会议的真实评审互动
待验证50%
9月23日
数据集包含一个300条人工标注的子集,用于审计自动化标注的可靠性
待验证50%
9月23日
审计结果显示自动标签与人类共识在90.3%的论断上保持一致,Cohen's Kappa系数达到0.87
待验证50%
9月23日
Peerify当前方法最大的难点来自模糊的、带解释性的审稿论断,这类论断难以找到明确的支持或反对证据
待验证50%
全部知识事实 (7)
待验证
Peerify系统构建了一条面向稿件事实核查的自动化流水线,用于判断每条审稿论断是否能在论文中找到支撑证据
50%待验证Peerify的核心流程分为三步:将评论分解为原子论断、检索相关的稿件证据、判定每条论断是否被论文所支持
50%待验证研究团队构建了一个包含800条论断的基准数据集,用于训练和评估流水线
50%待验证基准数据集中的论断来自NeurIPS 2024和ICLR 2024两个机器学习会议的真实评审互动
50%待验证数据集包含一个300条人工标注的子集,用于审计自动化标注的可靠性
50%待验证审计结果显示自动标签与人类共识在90.3%的论断上保持一致,Cohen's Kappa系数达到0.87
50%待验证Peerify当前方法最大的难点来自模糊的、带解释性的审稿论断,这类论断难以找到明确的支持或反对证据
50%