Unverified50% confidenceFactTime unknown
人类专家在MMMU Pro基准测试上的平均得分约为55%-65%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Related Claims
Unverified斯坦福HAI研究所2023年报告显示,最新LLM在HumanEval等代码基准测试中正确率已超过85%,远超2021年的不足50%68% similarUnverified2024年的多项研究表明,LLM裁判与人类专家的一致率通常在70%-85%之间66% similarUnverified该系统在50个已验证的CVE样本上实现了85%以上的检测准确率66% similarUnverified人类领域专家在 GPQA 上平均约得 65%65% similarUnverified人类在ARC-AGI测试上的平均得分约为85%,而顶尖AI模型长期徘徊在30%-60%区间63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/49607API
curl https://kongchang.com/api/v1/knowledge/claims/49607MCP
get_claim(id=49607)