[KongchangAI]
BenchmarkEI / EI 2.0

Evidence Inference 2.0

专门针对RCT文献理解构建的基准数据集,要求模型从完整科学论文中提取证据,判断某种干预对某项结局的效果方向,是医学NLP领域的重要评测基准

Timeline (last 90 days)

Oct 7

Fiorillo v0.5 为每个备选答案输出概率,针对 Evidence Inference 2.0 基准回答三分类问题:干预措施相对对照组是显著增加、显著降低还是没有显著改变某项结局指标

Unverified50%
Oct 7

EI 训练集共有 2,657 篇文章,研究者只使用了其中许可证明确允许复用的 1,431 篇

Unverified50%

All Facts (2)

Source Articles