待验证50% 置信事实精确时间
顶级AI模型在标准基准测试上的得分每6-9个月就会有显著跃升
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/5
首次发现
有效期至:2026/12/4
来源
涉及实体
相关事实
待验证AI能力的典型进步节奏约为每年15.5个ECI点,这是基于过去数年主流模型在多个基准上综合表现回归得出的经验值71% 相似待验证AI推理服务中的最高提速倍数通常指理想条件下的峰值表现,实际生产环境中用户体验的平均速度可能只有峰值的几分之一70% 相似待验证Scale AI在2024年的分析显示,部分模型在MMLU上的分数膨胀可能高达5-10个百分点,因测试集已泄露到训练数据中65% 相似待验证Long-Term团队实验表明,用同一个模型仅调整规则约束和记忆系统,成绩从52.8%涨到66.5%,排名从Top 30跳到Top 565% 相似待验证AI benchmark suites like MMLU, HumanEval, and MATH may produce inflated scores due to benchmark contamination, where models have indirectly encountered test data during training.64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/860971API
curl https://kongchang.com/api/v1/knowledge/claims/860971MCP
get_claim(id=860971)