Unverified50% confidenceBenchmarkExact time
开源模型中表现最好的MiniMax M3和Kimi在OSWorld 2.0完成率仅4.6%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/9/2026
First Seen
Valid until: 10/7/2026
Sources
OSWorld 2.0测评:最强AI Agent完成率仅20%,长流程是致命短板
bilibili熊二等兵7/1/2026
Related Claims
Unverified演示中使用的是MiniMax M3模型,而非市面上性能最强的模型,选型标准为够用、成本可靠68% similarUnverified在MiniMax的MMClaw评估中,M2.7在开放式工具调用场景下接近Sonnet 4.6的水平67% similarUnverifiedDeepSeek V4 Pro's Terminal Bench score is slightly above open-source models Kimi K2.6, GLM 5.1, and Minimax M2.766% similarUnverifiedMiniMax M3在复杂代码库功能扩展任务中,当Composer 2.5已完成任务时,MiniMax M3仍在分析代码库,但最终产出包含更多注释和更完善的测试覆盖63% similarUnverifiedMiniMax M2.7综合得分86.0分,被评为性价比之王63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/338176API
curl https://kongchang.com/api/v1/knowledge/claims/338176MCP
get_claim(id=338176)