Unverified50% confidenceBenchmarkExact time
RoboDojo具身智能测评显示,最强模型得分仅12.8分(人类基准为100分),仿真成功率不足9%,真机成功率12.8%
1
Sources
50%
Confidence
Long-term
Relevance
7/11/2026
First Seen
Sources
Grok 4.5发布:编码AI市场洗牌,Anthropic夺半壁江山
bilibili竹言见智7/9/2026
Related Claims
Unverified评测者认为任何超过7000分的表现代表卓越品质,低于6000分在当前标准下算不上高质量输出67% similarUnverifiedJCE所谓的'可靠'实际只有约60%的准确率,因误差累积连续5步后整体成功率仅剩约7.8%66% similarUnverifiedOSWorld 2.0中模型评估仅占总得分的11.53%,且没有任何任务的模型评估占比超过50%64% similarVerified如果一个10步操作中每步准确率为95%,整体成功率仅约60%64% similarUnverified每步60%准确率意味着连续5步后整体成功率约为7.8%(0.6的5次方)61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/487901API
curl https://kongchang.com/api/v1/knowledge/claims/487901MCP
get_claim(id=487901)