Unverified50% confidenceTradeoffExact time
OS World的82项测试并非在完全相同条件下运行,一半任务沿用原基线分数,投入资源和尝试次数也不同,因此7个百分点提升不能全归功于记忆
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/17/2026
First Seen
Valid until: 12/16/2026
Sources
Related Entities
Related Claims
Unverified在Agency工具调用测试中两款模型均得95分,唯一失败的都是第13号任务(美元到日元外币转换)68% similarUnverified该用户指出这些模型在基准测试中拿到很高分数,却在最简单的任务上频频失败67% similarUnverifiedOSWorld 2.0中模型评估仅占总得分的11.53%,且没有任何任务的模型评估占比超过50%66% similarUnverified在一个396个文件的大型混合职责项目上测试时,召回率几乎跌到零66% similarUnverified微软研究院调查发现跨iOS/Android双平台维护的测试套件中,每次大版本UI改版平均会导致60%以上的测试用例失效65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/929316API
curl https://kongchang.com/api/v1/knowledge/claims/929316MCP
get_claim(id=929316)