Unverified50% confidenceFactExact time
在DeepSWE上,各模型分数从顶部GPT 5.5的70%到底部Cloud Haiku 4.5的0%,区分度远大于SWE-Bench Pro约30分的集中区间
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
DeepSWE基准测试揭示真相:GPT 5.5大幅领先Opus 4.7
bilibili7k的每日搬运5/29/2026
Related Claims
Unverified在 DeepSWE 基准上,GPT-5.6 各推理档位得分分别为 Low 45 分、Medium 61 分、High 69 分、X-High 71 分、Max 73 分67% similarUnverifiedHaiku 4.5在SWE Bench上得分73.3%,略高于Sonnet 4,接近GPT-5 Codex水平。65% similarUnverified在SWE-bench最初公开结果中GPT-4的解决率仅约1.7%,Devin宣称达到13.86%,SWE-agent达到12.5%64% similarUnverifiedOllama分发的DeepSeek R1各版本均经过GGUF格式量化处理(通常为Q4_K_M或Q8_0精度),将每个参数从16位浮点数压缩至4-8位,显存占用减少50%-75%,推理质量损失通常在5%以内63% similarUnverifiedQwen3-4B在多项推理类评测指标上已与DeepSeek V3或GPT-4o相差无几63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/47590API
curl https://kongchang.com/api/v1/knowledge/claims/47590MCP
get_claim(id=47590)