Unverified70% confidenceFactTime unknown
2024年初SWE-Bench最好的系统得分仅在30%左右
1
Sources
70%
Confidence
Long-term
Relevance
6/3/2026
First Seen
Sources
谷歌Antigravity IDE深度体验:免费AI编码工具能否取代Cursor
bilibili薛定猫AI
Related Entities
Related Claims
Unverified2024年以前主流模型在SWE-bench上的通过率普遍低于5%,Claude 3.5系列发布后跃升至49%(SWE-bench Verified子集)59% similarUnverifiedCopilot功能与使用是GH-300官方权重最高的领域,约占25%~30%59% similarUnverified标注适配20-25C,实际用于28C外胎时偏紧但许多用户反馈仍可勉强使用,不过官方推荐搭配25C及以下外胎更为稳妥58% similarUnverifiedGrok 4.6在Terminal Bench上的成绩从前代的15%跃升至26%57% similarUnverified评测者认为通义千问3.6 27B是30B级别中对高考数学题表现最好的模型56% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/39864API
curl https://kongchang.com/api/v1/knowledge/claims/39864MCP
get_claim(id=39864)