基准EI / EI 2.0
Evidence Inference 2.0
专门针对RCT文献理解构建的基准数据集,要求模型从完整科学论文中提取证据,判断某种干预对某项结局的效果方向,是医学NLP领域的重要评测基准
时间轴 (近 90 天)
10月7日
Fiorillo v0.5 为每个备选答案输出概率,针对 Evidence Inference 2.0 基准回答三分类问题:干预措施相对对照组是显著增加、显著降低还是没有显著改变某项结局指标
待验证50%
10月7日
EI 训练集共有 2,657 篇文章,研究者只使用了其中许可证明确允许复用的 1,431 篇
待验证50%