[控场AI]
模型Fiorillo

Fiorillo v0.5

一个40亿参数的开源医学AI模型,基于Qwen3-4B-Base微调,专注于医学随机对照试验(RCT)证据判读任务,能为每个备选答案输出校准概率

时间轴 (近 90 天)

10月7日

Fiorillo v0.5 是一个仅 40 亿参数的开源模型,专门用于医学随机对照试验(RCT)证据判读任务

待验证50%
10月7日

Fiorillo v0.5 为每个备选答案输出概率,针对 Evidence Inference 2.0 基准回答三分类问题:干预措施相对对照组是显著增加、显著降低还是没有显著改变某项结局指标

待验证50%
10月7日

Fiorillo v0.5 的主力专家模块读取随机试验文章,截断至 6,144 个 token

待验证50%
10月7日

Fiorillo v0.5 以 Qwen3-4B-Base 为底座,叠加低秩适配器(LoRA)和一个专门的决策头,仅针对 EI 任务进行微调

待验证50%
10月7日

EI 训练集共有 2,657 篇文章,研究者只使用了其中许可证明确允许复用的 1,431 篇

待验证50%
10月7日

仅用许可干净的文章训练同一套配方,准确率下降了 0.0123(95% 区间 0.0034 到 0.0207)

待验证50%
10月7日

研究者在 Open Science Framework(OSF)上预先登记了四项发布标准,只有四项全部通过模型才会发布

待验证50%
10月7日

在包含 333 篇文章、1,218 条提示的测试集上,Fiorillo v0.5 的期望校准误差(ECE)为 0.0168,远低于预设上限 0.05

待验证50%
10月7日

Fiorillo v0.5 的对数损失比先验基线低 0.8603,比读取相同输入的 Gemma 模型低 0.1829

待验证50%
10月7日

Fiorillo v0.5 的宏观 F1(macro-F1)为 0.9248,对比基线的 0.8668

待验证50%

还有 5 条时间轴事件

全部知识事实 (15)

待验证

对于循证医学等高可靠性场景,能诚实表达不确定性的小模型可能比过度自信的大模型更实用,这是一种权衡

50%
待验证

Fiorillo v0.5 为每个备选答案输出概率,针对 Evidence Inference 2.0 基准回答三分类问题:干预措施相对对照组是显著增加、显著降低还是没有显著改变某项结局指标

50%
待验证

Fiorillo v0.5 的主力专家模块读取随机试验文章,截断至 6,144 个 token

50%
待验证

Fiorillo v0.5 以 Qwen3-4B-Base 为底座,叠加低秩适配器(LoRA)和一个专门的决策头,仅针对 EI 任务进行微调

50%
待验证

EI 训练集共有 2,657 篇文章,研究者只使用了其中许可证明确允许复用的 1,431 篇

50%
待验证

仅用许可干净的文章训练同一套配方,准确率下降了 0.0123(95% 区间 0.0034 到 0.0207)

50%
待验证

研究者在 Open Science Framework(OSF)上预先登记了四项发布标准,只有四项全部通过模型才会发布

50%
待验证

在包含 333 篇文章、1,218 条提示的测试集上,Fiorillo v0.5 的期望校准误差(ECE)为 0.0168,远低于预设上限 0.05

50%
待验证

Fiorillo v0.5 的对数损失比先验基线低 0.8603,比读取相同输入的 Gemma 模型低 0.1829

50%
待验证

Fiorillo v0.5 的宏观 F1(macro-F1)为 0.9248,对比基线的 0.8668

50%
待验证

完全不给文章时,Fiorillo v0.5 的宏观 F1 骤降至 0.4384,说明模型依赖正文内容

50%
待验证

只给标题就能把 Fiorillo v0.5 的 F1 提升 0.0939,可能存在从标题泄露答案的成分

50%
待验证

当交换干预组与对照组时,Fiorillo v0.5 有 0.6652 的方向性答案发生翻转,说明模型理解因果方向关系

50%
待验证

Fiorillo v0.5 是一个仅 40 亿参数的开源模型,专门用于医学随机对照试验(RCT)证据判读任务

50%
待验证

Fiorillo v0.5 以 Apache License 2.0 发布,DOI 为 10.57967/hf/10722

50%

来源文章