待验证90% 置信事实时间未知
使用更强回答LLM(Claude Sonnet 4)替换GPT-4 Mini后,仅缺失任务略有提升,级联任务无明显改善
1
来源数
90%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
MEME基准测试揭示LLM记忆系统致命缺陷:依赖推理准确率不足50%
bilibili熊二等兵
涉及实体
相关事实
待验证在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%77% 相似待验证Claude 4.5 Sonnet在实际使用中的性能提升仅约10%,远无法匹敌Opus在调试、规划等复杂任务上的能力73% 相似待验证Claude Sonnet 4.6与GPT-5.1 Codex在SWE-Bench Verified上的解决率差距仅为3.3个百分点71% 相似待验证Sonnet 4.6与Opus 4.6相比,在大多数基准测试中表现几乎持平,但推理速度更快、调用成本更低70% 相似待验证从Claude 3 Sonnet到Claude 3.5 Sonnet再到Claude 4 Sonnet,每次升级在编码基准测试上的得分提升幅度呈递减趋势,早期版本间的跳跃可能是10-20个百分点的提升,而后续版本间的差距往往缩小到2-5个百分点70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/21554API
curl https://kongchang.com/api/v1/knowledge/claims/21554MCP
get_claim(id=21554)