已验证70% 置信基准精确时间
在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内
4
来源数
70%
置信度
中期 (~90 天)
时效性
2026/7/24
首次发现
有效期至:2026/10/22
来源
Anthropic放弃订阅制转向按量计费,是明智还是自断后路?
redditr/ClaudeAI2026/7/12
相关事实
待验证在EvoArena测试中,Step Level最高的GPT-5.5只有50%出头的准确率,Chain Level表现最好的Gemini-3.1 Pro和GLM-5.1也只有约28%-29%71% 相似待验证Models like GPT-4 and Claude 3.5 surpassed 90% accuracy on MMLU, significantly diminishing its discriminative power69% 相似待验证2024-2025年间,Claude 3.5 Sonnet、GPT-4o、Gemini 2.0等模型在HumanEval、SWE-bench等编程基准测试的通过率从不足50%提升至90%以上69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/608322API
curl https://kongchang.com/api/v1/knowledge/claims/608322MCP
get_claim(id=608322)