[控场AI]
基准EI / EI 2.0

Evidence Inference 2.0

专门针对RCT文献理解构建的基准数据集,要求模型从完整科学论文中提取证据,判断某种干预对某项结局的效果方向,是医学NLP领域的重要评测基准

时间轴 (近 90 天)

10月7日

Fiorillo v0.5 为每个备选答案输出概率,针对 Evidence Inference 2.0 基准回答三分类问题:干预措施相对对照组是显著增加、显著降低还是没有显著改变某项结局指标

待验证50%
10月7日

EI 训练集共有 2,657 篇文章,研究者只使用了其中许可证明确允许复用的 1,431 篇

待验证50%

全部知识事实 (2)

来源文章