Unverified50% confidenceFactExact time
OSWorld 2.0中模型评估仅占总得分的11.53%,且没有任何任务的模型评估占比超过50%
1
Sources
50%
Confidence
Long-term
Relevance
7/9/2026
First Seen
Sources
OSWorld 2.0测评:最强AI Agent完成率仅20%,长流程是致命短板
bilibili熊二等兵7/1/2026
Related Claims
UnverifiedRoboDojo具身智能测评显示,最强模型得分仅12.8分(人类基准为100分),仿真成功率不足9%,真机成功率12.8%64% similarUnverifiedFactoryDroid跑同样的Opus模型提交成绩为69.9%,而CloudCode为58%,但这是厂商自行提交的数据58% similarUnverified一个61分的模型和一个59分的模型在多数实际应用中的差异可能远小于分数暗示的程度58% similarUnverified在Agency工具调用测试中两款模型均得95分,唯一失败的都是第13号任务(美元到日元外币转换)58% similarUnverifiedDevin 2.0在SWE-bench基准测试中解决了13.86%的实际编程问题,而此前的AI模型仅为1.96%58% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/338173API
curl https://kongchang.com/api/v1/knowledge/claims/338173MCP
get_claim(id=338173)