[控场AI]
已验证70% 置信基准精确时间

在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内

4
来源数
70%
置信度
中期 (~90 天)
时效性
2026/7/24
首次发现
有效期至:2026/10/22

来源

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/608322
API
curl https://kongchang.com/api/v1/knowledge/claims/608322
MCP
get_claim(id=608322)