Unverified90% confidenceFactTime unknown
使用更强回答LLM(Claude Sonnet 4)替换GPT-4 Mini后,仅缺失任务略有提升,级联任务无明显改善
1
Sources
90%
Confidence
Medium-term (~90 days)
Relevance
6/1/2026
First Seen
Valid until: 8/30/2026
Sources
MEME基准测试揭示LLM记忆系统致命缺陷:依赖推理准确率不足50%
bilibili熊二等兵
Related Entities
Related Claims
Unverified在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%77% similarUnverifiedClaude 4.5 Sonnet在实际使用中的性能提升仅约10%,远无法匹敌Opus在调试、规划等复杂任务上的能力73% similarUnverifiedClaude Sonnet 4.6与GPT-5.1 Codex在SWE-Bench Verified上的解决率差距仅为3.3个百分点71% similarUnverifiedSonnet 4.6与Opus 4.6相比,在大多数基准测试中表现几乎持平,但推理速度更快、调用成本更低70% similarUnverified从Claude 3 Sonnet到Claude 3.5 Sonnet再到Claude 4 Sonnet,每次升级在编码基准测试上的得分提升幅度呈递减趋势,早期版本间的跳跃可能是10-20个百分点的提升,而后续版本间的差距往往缩小到2-5个百分点70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/21554API
curl https://kongchang.com/api/v1/knowledge/claims/21554MCP
get_claim(id=21554)