Unverified50% confidenceFactExact time
GAIA题目对人类来说相对简单,人类平均正确率约92%,但对顶级AI模型极具挑战性
1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen
Sources
Rust AI Agent实战:GAIA基准测试揭示大模型能力天花板
bilibili软件工艺师7/10/2026
Related Claims
Unverified在AI作品占比不高(如仅5%)的场景下,即使检测准确率达90%,被标记的作品中超过三分之二实际上是人类创作,这属于贝叶斯推理中的基准率谬误69% similarUnverified人类在ARC-AGI测试上的平均得分约为85%,而顶尖AI模型长期徘徊在30%-60%区间69% similarUnverified在简单视觉感知任务上,普通人类能达到90%以上准确率,而多数SOTA模型只有50%甚至更低67% similarUnverified基准过拟合是当前大模型评估的核心问题,部分模型在HumanEval上达到90%以上通过率但在真实代码库中表现远不如预期66% similarUnverified2023年人类在GAIA测试中的平均成功率约为90%,而当时最强的GPT-4在Level 1上仅勉强达到15%66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/489029API
curl https://kongchang.com/api/v1/knowledge/claims/489029MCP
get_claim(id=489029)