Unverified50% confidenceBenchmarkExact time
在包含 333 篇文章、1,218 条提示的测试集上,Fiorillo v0.5 的期望校准误差(ECE)为 0.0168,远低于预设上限 0.05
1
Sources
50%
Confidence
Long-term
Relevance
10/7/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedFiorillo v0.5 的对数损失比先验基线低 0.8603,比读取相同输入的 Gemma 模型低 0.182967% similarUnverified在该研究主要的十个LLM评审组成的评审库中,评审错误之间的平均两两相关系数为0.2167% similarUnverified研究者训练的2900万参数编码器对985条陈述的流行度加权跨折AUC仅为0.486,与语料库先验无法区分67% similarUnverified在一个396个文件的大型混合职责项目上测试时,召回率几乎跌到零66% similarUnverified测试的准确率数据在n=100样本量下误差约为±8-10个百分点(基于95%置信水平的二项分布置信区间)66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/983038API
curl https://kongchang.com/api/v1/knowledge/claims/983038MCP
get_claim(id=983038)