Unverified70% confidenceFactTime unknown
人类在OS World测试中的平均得分约为72-74%
1
Sources
70%
Confidence
Long-term
Relevance
5/31/2026
First Seen
Sources
Claude Sonnet 4.6评测:十分之一价格实现旗舰级AI性能
bilibili乱砍一通
Related Entities
Related Claims
Unverified研究表明LLM裁判与人类评分的一致率约为80%,接近但尚未超越人类自身一致性水平(约81%)62% similarUnverified当前最强模型在GUI操作上的得分约为78%,Browser Use和Computer Use只能作为兜底方案59% similarUnverified在网页浏览基准BrowseComp上Sol拿到92.2%,在OSWorld 2.0上拿到62.6%,两项均为当前最佳成绩,OSWorld上超过Opus 4.8的同时输出Token减少85%59% similarUnverified在Terminal Bench 2.1基准测试上,Ultra模式接近92%,超越竞品的88%表现58% similarUnverifiedAnthropic的Computer Use在OSWorld基准测试上的操作准确率约为14.9%(2024年10月数据)57% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/13718API
curl https://kongchang.com/api/v1/knowledge/claims/13718MCP
get_claim(id=13718)