Unverified60% confidenceFactTime unknown
MiniMax M2.1在SWE-Bench基准测试上的表现持平甚至超过Claude Sonnet 4.5
2
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
5/31/2026
First Seen
Valid until: 8/29/2026
Sources
Cursor+Skills搭建财报分析AI Agent:从零到一实战教程
bilibiliAfterShip
Related Entities
Related Claims
Unverified在MiniMax的MMClaw评估中,M2.7在开放式工具调用场景下接近Sonnet 4.6的水平76% similarUnverifiedMiniMax M3 的基准测试成绩亮眼,部分指标据称可比肩 GPT-5.576% similarUnverifiedSWE-Bench工程实战测试第一名是近期发布的MiniMax M2(397B)75% similarUnverifiedMiniMax M2.7在SWE-Pro基准测试上得分56.22%73% similarUnverified在智能体搜索测试中,Sonnet 5 各 effort level 下均优于 Sonnet 4.6,但整体性能低于 Opus 4.8,综合约在 Opus 4.7 级别73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/3031API
curl https://kongchang.com/api/v1/knowledge/claims/3031MCP
get_claim(id=3031)