Fiorillo v0.5:40亿参数开源模型如何给随机试验问题打出校准概率

40亿参数模型Fiorillo v0.5以预注册评估、概率校准和合规开源,示范负责任的垂直小模型发布范式。
Fiorillo v0.5是一个仅40亿参数的开源模型,专注于医学随机对照试验(RCT)证据的三分类判读任务:判断某项干预相对于对照组是否显著增加、降低或未改变某项结局指标。其架构以Qwen3-4B-Base为底座,叠加LoRA适配器和专用决策头,输出校准概率而非单纯类别标签。研究者在发布前于OSF预注册四项通过标准,测试集上期望校准误差仅0.0168、宏观F1达0.9248,四项全部通过后才公开发布。训练数据仅使用版权许可明确的1,431篇文章,牺牲约1.23%准确率换取合规,最终以Apache 2.0许可开源。消融实验揭示了仅凭标题泄露答案、交换干预与对照组可翻转66.5%方向性答案等局限,作者主动公开量化这些问题,体现了负责任的科学态度。
一个专注回答随机试验问题的小模型
大模型越做越大的今天,一项发表于 arXiv 的研究反其道而行之:用一个仅 40 亿参数的开源模型 Fiorillo v0.5,专门解决医学随机对照试验(RCT)证据判读这一垂直任务,并且在发布前就通过了预先登记的严格检验。
Fiorillo v0.5 的核心能力不是生成一段看似合理的文本,而是为每个备选答案输出一个概率。它的主力专家模块读取一篇随机试验文章(截断至 6,144 个 token),针对 Evidence Inference 2.0(EI)基准回答一个三分类问题:相对于对照组,某项干预措施是否显著增加、显著降低或没有显著改变某项结局指标。
这是一个高度结构化、对事实准确性要求极高的任务,恰恰是通用大模型容易"自信地说错"的地方。Fiorillo 的思路是:与其追求全能,不如在一个明确场景中把概率校准做到位。

随机对照试验(RCT)是循证医学的核心证据来源。在一项典型的RCT中,受试者被随机分配到干预组(接受新疗法)和对照组(接受安慰剂或标准疗法),通过比较两组在特定结局指标上的差异来评估干预效果。Evidence Inference 2.0(EI)是专门针对RCT文献理解构建的基准数据集,要求模型从一篇完整的科学论文中提取证据,判断某种干预对某项结局的效果方向——三个类别分别对应"显著增加""显著降低"和"无显著差异"。这一任务的难点在于:模型不仅要读懂统计显著性描述,还需要正确理解干预组与对照组的方向关系,任何方向性混淆都会直接导致错误的医学推断。
技术路线:Qwen3-4B 加低秩适配器与决策头
从架构上看,Fiorillo v0.5 并非从零训练,而是以 Qwen3-4B-Base 为底座,叠加低秩适配器(LoRA)和一个专门的决策头(decision head),仅针对 EI 任务进行微调。这种做法成本可控,也让小团队有能力复现。
一个值得关注的细节是训练数据的处理方式。EI 训练集共有 2,657 篇文章,研究者只使用了其中许可证明确允许复用的 1,431 篇。换句话说,他们主动放弃了超过四成的可用数据,以换取发布时在版权上的"干净"。
这一选择是有代价的。研究显示,仅用许可干净的文章训练同一套配方,准确率下降了 0.0123(95% 区间 0.0034 到 0.0207,描述性结果)。这个代价量化地呈现了"合规"与"性能"之间的权衡——约一个百分点的准确率,换来一个可以放心按 Apache License 2.0 发布的模型。
低秩适配器(LoRA,Low-Rank Adaptation)是一种参数高效的微调方法。其原理是在预训练模型的权重矩阵旁边插入两个低秩矩阵的乘积,训练时只更新这两个小矩阵,而冻结原始模型的绝大部分参数。这样做的好处是:可训练参数量通常只有原模型的0.1%到1%,显著降低了计算成本和显存需求,同时保留了预训练阶段积累的语言理解能力。在Fiorillo的设计中,LoRA模块负责将Qwen3-4B的通用语言能力向RCT证据理解方向专化,而专门添加的决策头(decision head)则将模型的内部表示映射为三个类别的概率分布,直接输出校准后的置信度,而非仅仅给出最高概率类别的标签。
四项预登记标准:发布前就定好及格线
Fiorillo v0.5 最具方法论意义的部分,是它把发布决策与预注册检验绑定在一起。研究者在 Open Science Framework(OSF)上预先登记了四项标准,并以 EI 测试集(其标签是公开的)上的表现作为第二道门槛。只有四项全部通过,模型才会发布。
在包含 333 篇文章、1,218 条提示的测试集上,结果如下:
- 期望校准误差(ECE):0.0168,远低于预设上限 0.05。这意味着模型给出的概率与实际正确率高度吻合,不是虚高的自信。
- 对数损失(log loss):比先验基线低 0.8603(95% 区间 0.8104 到 0.9078),比读取相同输入的 Gemma 模型低 0.1829(0.1164 到 0.2598)。
- 宏观 F1(macro-F1):0.9248,对比基线的 0.8668。
四项标准全部通过。这种"先立规矩、后看结果、结果决定是否发布"的流程,在机器学习领域相对少见,它把科学实验中的预注册传统引入了模型评估,有效降低了事后挑选有利指标的空间。
预注册(Pre-registration)源自临床医学和心理学领域,是指研究者在收集或分析数据之前,将研究假设、方法和分析计划公开登记在独立平台上(如OSF,即开放科学框架),从而防止事后根据结果调整统计假设或选择性报告有利数据——这类行为在学术上称为"p-hacking"或"结果导向分析"。期望校准误差(ECE,Expected Calibration Error)则是衡量模型概率输出可靠性的核心指标:它计算模型预测置信度与实际准确率之间的平均偏差。ECE为0意味着模型说"有80%把握"的预测中恰好有80%是正确的;ECE越高,说明模型的置信度越不可信——过高的ECE在医疗辅助决策场景中可能导致使用者对错误答案产生错误信任。
消融实验揭示模型到底在读什么
论文中的几组对照实验,暴露出模型决策所依赖的信息来源,也值得研究者警惕。
当完全不给文章时,宏观 F1 骤降至 0.4384,说明模型确实依赖正文内容而非凭空猜测。但只给标题就能把 F1 提升 0.0939(0.0655 到 0.1234)——研究者指出,这可能是因为某些标题本身就陈述了试验结果,或触发了模型对该试验的记忆。这提醒我们,基准分数里可能混入了"从标题泄露答案"的成分。
更有意思的是方向性测试:当交换干预组与对照组时,模型有 0.6652 的方向性答案发生了翻转。这说明模型确实在理解"谁相对谁"的因果方向,而非机械匹配关键词——这对医学证据判读是必需的能力。
可复现性与开放许可
研究者强调,按发布版本实际运行时,输出文件与此前评估所用的预测在预设误差范围内一致。也就是说,论文里报告的数字,使用者自己能复现出来。
模型以 Apache License 2.0 发布(DOI: 10.57967/hf/10722),这是一个商业友好的宽松许可证。配合前述"只用许可干净数据训练"的选择,整个发布链条在法律合规性上做到了相对完整,降低了下游使用者的版权风险。
为什么这项工作值得关注
Fiorillo v0.5 的意义不在于刷新了某个榜单,而在于它示范了一种更负责任的小模型发布范式:明确任务边界、输出校准概率、预注册评估标准、使用合规数据、宽松开源许可。对于循证医学、系统综述自动化等对可靠性要求极高的场景,一个能诚实表达不确定性的 40 亿参数模型,往往比一个动辄千亿参数却"过度自信"的通用模型更实用。
当然,消融实验也诚实地暴露了局限:标题泄露、数据集偏差等问题依然存在,说明这类基准本身的设计仍有改进空间。但把这些问题公开量化出来,本身就是科学态度的体现。
相关推荐

AI SDK 发布版本更新:sandbox-just-bash 组件信息速览
AI SDK 生态组件 @ai-sdk/sandbox-just-bash 发布 1.0.147 补丁更新,同步 @ai-sdk/harness 依赖。本文梳理该发布记录的版本信息与升级建议。

@ai-sdk/sandbox-vercel 1.0.147 发布说明
@ai-sdk/sandbox-vercel 1.0.147 版本发布,这是一次补丁级更新,主要同步升级内部依赖 @ai-sdk/harness 至相同版本,通过 GitHub 可信签名验证。

ChatGPT洗碗记:一支叉子引发的AI过度推理反思
一支洗碗机没洗净的叉子,引发AI启动"深度研究"、消耗海量算力甚至挑战纳维-斯托克斯千禧难题的荒诞实验。这则ChatGPT洗碗讽刺视频,折射出AI过度推理、算力成本与场景错配的真实困境。