Unverified50% confidenceBenchmarkExact time
斯坦福大学2024年的AgentBench基准测试显示,GPT-4级别模型在需要跨系统协调的复杂任务中端到端成功率低于30%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/12/2026
First Seen
Valid until: 10/10/2026
Sources
扎克伯格坦承AI进展不及预期:裁员之后的行业真相
bilibili小溪_YouTube搬运笔记本7/8/2026
Related Claims
Unverified以GPT-4为例,单次复杂Agent任务可能涉及5-20次LLM调用80% similarVerified斯坦福大学曾发布研究报告,记录了GPT-4在特定任务上跨时间段的性能波动79% similarUnverified斯坦福大学2023年的研究发现GPT-4在某些任务上的表现在数月内出现了可测量的下降78% similarUnverified最新的开源模型已在特定任务上的多项基准测试中达到甚至超越GPT-4级别的表现78% similarUnverifiedOpenAI的API端点名称不变时底层模型权重可能被静默更新,2023年Stanford和UC Berkeley联合研究发现GPT-4在不同时期对相同prompt的表现存在显著差异,某些任务准确率从97%骤降到2%77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/489815API
curl https://kongchang.com/api/v1/knowledge/claims/489815MCP
get_claim(id=489815)