待验证50% 置信基准精确时间
斯坦福大学HAI研究所2024年度AI指数报告显示,顶级闭源模型在MMLU基准上的最高分与第五名之间的差距,已从2022年的约8个百分点收窄至不足2个百分点
1
来源数
50%
置信度
长期有效
时效性
2026/7/21
首次发现
来源
相关事实
待验证在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点72% 相似待验证斯坦福大学2023年发布的Lost in the Middle研究(Liu et al.)显示,当关键信息位于上下文中间段时,模型检索准确率相比头部和尾部下降约20-30个百分点,且在上下文超过32K token时尤为显著71% 相似待验证Scale AI在2024年的分析显示,部分模型在MMLU上的分数膨胀可能高达5-10个百分点,因测试集已泄露到训练数据中70% 相似待验证自2024年下半年以来,主流大模型在MMLU和HumanEval等标准基准测试上的分数提升明显收窄70% 相似待验证斯坦福大学2023年研究表明,即便是当时最先进的模型,在处理超过32K Token的上下文时,对中间段落的信息提取准确率会下降30%至50%68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/584919API
curl https://kongchang.com/api/v1/knowledge/claims/584919MCP
get_claim(id=584919)