Unverified50% confidenceBenchmarkExact time
评估Agent规划能力的主流基准测试包括ALFWorld、WebArena和GAIA,当前最先进模型得分仍远低于人类水平
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/12/2026
First Seen
Valid until: 10/10/2026
Sources
AI Agent入门:概念、架构与核心组成全解析
bilibili李宏毅-机器学习7/10/2026
Related Claims
Unverified当前顶尖AI模型在CTF基准上的得分仍远低于人类专家水平,尤其是涉及动态调试和二进制分析的题目类别73% similarUnverified2023年多项学术研究显示在模拟对抗性环境中主流目标检测算法的准确率可下降40-80%69% similarUnverified美团LongCat推出Lohosearch搜索智能体基准,11个前沿模型测试中最佳得分仅34.74%,远低于人类约90%的表现68% similarUnverified在事实性评估任务上模型评判者准确率仍显著低于人类专家,但在风格、连贯性等主观维度已接近人类评审员间一致性水平67% similarUnverifiedGAIA题目对人类来说相对简单,人类平均正确率约92%,但对顶级AI模型极具挑战性66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/489074API
curl https://kongchang.com/api/v1/knowledge/claims/489074MCP
get_claim(id=489074)