Unverified60% confidenceFactExact time
According to the OSWorld benchmark, the most advanced Computer Use models still achieve less than 40% task success rate
2
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Related Claims
Unverified当前最优模型在 WebArena、Mind2Web 等基准测试上的任务完成率通常在 20%-40% 之间71% similarUnverified研究表明将复杂需求拆解为多个小任务比一次性提交完整需求的成功率高出40%以上68% similarUnverified据公开评测现有桌面Agent在复杂工作流中的成功率普遍低于50%67% similarUnverified英伟达H200相比A100在特定任务上推理效率提升约3倍,但模型参数规模同步扩张几乎抵消了硬件进步带来的成本红利65% similarUnverifiedPrompt优先方案(用一条超长指令串起数据分析流程)实测成功率不到40%65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/46722API
curl https://kongchang.com/api/v1/knowledge/claims/46722MCP
get_claim(id=46722)