Unverified50% confidenceFactExact time
OSWorld 2.0采用细粒度检查点部分奖励评分,平均每个任务有27.25个检查点,不要求固定顺序
1
Sources
50%
Confidence
Long-term
Relevance
7/9/2026
First Seen
Sources
OSWorld 2.0测评:最强AI Agent完成率仅20%,长流程是致命短板
bilibili熊二等兵7/1/2026
Related Claims
Unverified实测中使用AnySearch Skill完成搜索任务消耗18个额度点,不使用时消耗23个额度点,节省约27%64% similarUnverified测试者评估Codex大概能完成看板上30%的任务57% similarUnverifiedMiniMax M2.7每任务提问0.6个问题,但澄清推进率只有60.7%,存在低信息增益提问问题56% similarUnverified根据Artificial Analysis数据,Fable完成单个任务约用33k token,Opus 5约用37k token55% similarUnverifiedMiniMax M3 在7个高难度任务测试中获得平均58.3分55% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/338172API
curl https://kongchang.com/api/v1/knowledge/claims/338172MCP
get_claim(id=338172)