待验证50% 置信基准精确时间
自2023年GPT-4发布以来,AI在HumanEval等主流编程基准测试上的通过率从不足50%跃升至90%以上
1
来源数
50%
置信度
长期有效
时效性
2026/7/23
首次发现
来源
相关事实
待验证2025年的顶尖模型在HumanEval基准测试中的通过率已突破90%76% 相似已验证代码生成模型在HumanEval等基准测试中的通过率从60%跃升至90%以上(2024-2025年间)74% 相似待验证斯坦福HAI研究所2023年报告显示,最新LLM在HumanEval等代码基准测试中正确率已超过85%,远超2021年的不足50%73% 相似待验证2023年人类在GAIA测试中的平均成功率约为90%,而当时最强的GPT-4在Level 1上仅勉强达到15%72% 相似待验证ARC-AGI-2由AI安全研究员François Chollet设计,早期GPT-4在该测试上得分不足10%,人类平均得分约85%71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/596316API
curl https://kongchang.com/api/v1/knowledge/claims/596316MCP
get_claim(id=596316)