待验证70% 置信事实时间未知
人类在OS World测试中的平均得分约为72-74%
1
来源数
70%
置信度
长期有效
时效性
2026/5/31
首次发现
来源
Claude Sonnet 4.6评测:十分之一价格实现旗舰级AI性能
bilibili乱砍一通
涉及实体
相关事实
待验证研究表明LLM裁判与人类评分的一致率约为80%,接近但尚未超越人类自身一致性水平(约81%)62% 相似待验证当前最强模型在GUI操作上的得分约为78%,Browser Use和Computer Use只能作为兜底方案59% 相似待验证在网页浏览基准BrowseComp上Sol拿到92.2%,在OSWorld 2.0上拿到62.6%,两项均为当前最佳成绩,OSWorld上超过Opus 4.8的同时输出Token减少85%59% 相似待验证在Terminal Bench 2.1基准测试上,Ultra模式接近92%,超越竞品的88%表现58% 相似待验证Anthropic的Computer Use在OSWorld基准测试上的操作准确率约为14.9%(2024年10月数据)57% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13718API
curl https://kongchang.com/api/v1/knowledge/claims/13718MCP
get_claim(id=13718)