BenchmarkEI / EI 2.0
Evidence Inference 2.0
专门针对RCT文献理解构建的基准数据集,要求模型从完整科学论文中提取证据,判断某种干预对某项结局的效果方向,是医学NLP领域的重要评测基准
Timeline (last 90 days)
Oct 7
Fiorillo v0.5 为每个备选答案输出概率,针对 Evidence Inference 2.0 基准回答三分类问题:干预措施相对对照组是显著增加、显著降低还是没有显著改变某项结局指标
Unverified50%
Oct 7
EI 训练集共有 2,657 篇文章,研究者只使用了其中许可证明确允许复用的 1,431 篇
Unverified50%