待验证50% 置信事实精确时间
OSWorld 2.0中模型评估仅占总得分的11.53%,且没有任何任务的模型评估占比超过50%
1
来源数
50%
置信度
长期有效
时效性
2026/7/9
首次发现
来源
OSWorld 2.0测评:最强AI Agent完成率仅20%,长流程是致命短板
bilibili熊二等兵2026/7/1
相关事实
待验证RoboDojo具身智能测评显示,最强模型得分仅12.8分(人类基准为100分),仿真成功率不足9%,真机成功率12.8%64% 相似待验证FactoryDroid跑同样的Opus模型提交成绩为69.9%,而CloudCode为58%,但这是厂商自行提交的数据58% 相似待验证一个61分的模型和一个59分的模型在多数实际应用中的差异可能远小于分数暗示的程度58% 相似待验证在Agency工具调用测试中两款模型均得95分,唯一失败的都是第13号任务(美元到日元外币转换)58% 相似待验证Devin 2.0在SWE-bench基准测试中解决了13.86%的实际编程问题,而此前的AI模型仅为1.96%58% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/338173API
curl https://kongchang.com/api/v1/knowledge/claims/338173MCP
get_claim(id=338173)