待验证50% 置信基准精确时间
开源模型中表现最好的MiniMax M3和Kimi在OSWorld 2.0完成率仅4.6%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/9
首次发现
有效期至:2026/10/7
来源
OSWorld 2.0测评:最强AI Agent完成率仅20%,长流程是致命短板
bilibili熊二等兵2026/7/1
相关事实
待验证演示中使用的是MiniMax M3模型,而非市面上性能最强的模型,选型标准为够用、成本可靠68% 相似待验证在MiniMax的MMClaw评估中,M2.7在开放式工具调用场景下接近Sonnet 4.6的水平67% 相似待验证DeepSeek V4 Pro's Terminal Bench score is slightly above open-source models Kimi K2.6, GLM 5.1, and Minimax M2.766% 相似待验证MiniMax M3在复杂代码库功能扩展任务中,当Composer 2.5已完成任务时,MiniMax M3仍在分析代码库,但最终产出包含更多注释和更完善的测试覆盖63% 相似待验证MiniMax M2.7综合得分86.0分,被评为性价比之王63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/338176API
curl https://kongchang.com/api/v1/knowledge/claims/338176MCP
get_claim(id=338176)