待验证50% 置信事实精确时间
在DeepSWE上,各模型分数从顶部GPT 5.5的70%到底部Cloud Haiku 4.5的0%,区分度远大于SWE-Bench Pro约30分的集中区间
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
DeepSWE基准测试揭示真相:GPT 5.5大幅领先Opus 4.7
bilibili7k的每日搬运2026/5/29
相关事实
待验证在 DeepSWE 基准上,GPT-5.6 各推理档位得分分别为 Low 45 分、Medium 61 分、High 69 分、X-High 71 分、Max 73 分67% 相似待验证Haiku 4.5在SWE Bench上得分73.3%,略高于Sonnet 4,接近GPT-5 Codex水平。65% 相似待验证在SWE-bench最初公开结果中GPT-4的解决率仅约1.7%,Devin宣称达到13.86%,SWE-agent达到12.5%64% 相似待验证Ollama分发的DeepSeek R1各版本均经过GGUF格式量化处理(通常为Q4_K_M或Q8_0精度),将每个参数从16位浮点数压缩至4-8位,显存占用减少50%-75%,推理质量损失通常在5%以内63% 相似待验证Qwen3-4B在多项推理类评测指标上已与DeepSeek V3或GPT-4o相差无几63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/47590API
curl https://kongchang.com/api/v1/knowledge/claims/47590MCP
get_claim(id=47590)