Fiorillo v0.5
一个40亿参数的开源医学AI模型,基于Qwen3-4B-Base微调,专注于医学随机对照试验(RCT)证据判读任务,能为每个备选答案输出校准概率
Timeline (last 90 days)
Fiorillo v0.5 是一个仅 40 亿参数的开源模型,专门用于医学随机对照试验(RCT)证据判读任务
Fiorillo v0.5 为每个备选答案输出概率,针对 Evidence Inference 2.0 基准回答三分类问题:干预措施相对对照组是显著增加、显著降低还是没有显著改变某项结局指标
Fiorillo v0.5 的主力专家模块读取随机试验文章,截断至 6,144 个 token
Fiorillo v0.5 以 Qwen3-4B-Base 为底座,叠加低秩适配器(LoRA)和一个专门的决策头,仅针对 EI 任务进行微调
EI 训练集共有 2,657 篇文章,研究者只使用了其中许可证明确允许复用的 1,431 篇
仅用许可干净的文章训练同一套配方,准确率下降了 0.0123(95% 区间 0.0034 到 0.0207)
研究者在 Open Science Framework(OSF)上预先登记了四项发布标准,只有四项全部通过模型才会发布
在包含 333 篇文章、1,218 条提示的测试集上,Fiorillo v0.5 的期望校准误差(ECE)为 0.0168,远低于预设上限 0.05
Fiorillo v0.5 的对数损失比先验基线低 0.8603,比读取相同输入的 Gemma 模型低 0.1829
Fiorillo v0.5 的宏观 F1(macro-F1)为 0.9248,对比基线的 0.8668
5 more timeline events
All Facts (15)
对于循证医学等高可靠性场景,能诚实表达不确定性的小模型可能比过度自信的大模型更实用,这是一种权衡
50%UnverifiedFiorillo v0.5 为每个备选答案输出概率,针对 Evidence Inference 2.0 基准回答三分类问题:干预措施相对对照组是显著增加、显著降低还是没有显著改变某项结局指标
50%UnverifiedFiorillo v0.5 的主力专家模块读取随机试验文章,截断至 6,144 个 token
50%UnverifiedFiorillo v0.5 以 Qwen3-4B-Base 为底座,叠加低秩适配器(LoRA)和一个专门的决策头,仅针对 EI 任务进行微调
50%UnverifiedEI 训练集共有 2,657 篇文章,研究者只使用了其中许可证明确允许复用的 1,431 篇
50%Unverified仅用许可干净的文章训练同一套配方,准确率下降了 0.0123(95% 区间 0.0034 到 0.0207)
50%Unverified研究者在 Open Science Framework(OSF)上预先登记了四项发布标准,只有四项全部通过模型才会发布
50%Unverified在包含 333 篇文章、1,218 条提示的测试集上,Fiorillo v0.5 的期望校准误差(ECE)为 0.0168,远低于预设上限 0.05
50%UnverifiedFiorillo v0.5 的对数损失比先验基线低 0.8603,比读取相同输入的 Gemma 模型低 0.1829
50%UnverifiedFiorillo v0.5 的宏观 F1(macro-F1)为 0.9248,对比基线的 0.8668
50%Unverified完全不给文章时,Fiorillo v0.5 的宏观 F1 骤降至 0.4384,说明模型依赖正文内容
50%Unverified只给标题就能把 Fiorillo v0.5 的 F1 提升 0.0939,可能存在从标题泄露答案的成分
50%Unverified当交换干预组与对照组时,Fiorillo v0.5 有 0.6652 的方向性答案发生翻转,说明模型理解因果方向关系
50%UnverifiedFiorillo v0.5 是一个仅 40 亿参数的开源模型,专门用于医学随机对照试验(RCT)证据判读任务
50%UnverifiedFiorillo v0.5 以 Apache License 2.0 发布,DOI 为 10.57967/hf/10722
50%