待验证75% 置信观点时间未知
测试者建议涉及代码生成、逻辑推理、空间理解的场景应使用Claude Sonnet 3.5或更高级别的模型,而非Claude Haiku 4.5
1
来源数
75%
置信度
中期 (~90 天)
时效性
2026/6/3
首次发现
有效期至:2026/9/1
来源
Claude Haiku 4.5实测:5项编程任务全面翻车
bilibilikarminski-牙医
涉及实体
相关事实
待验证在Pillow库RGB转HSV精度Bug测试中,Claude Code使用Sonnet 4.6模型一次通过,逻辑清晰,获得满分73% 相似待验证代码理解与生成能力强的模型(如Claude 3.5 Sonnet、GPT-4o)在处理混淆JS时通常表现更稳定68% 相似待验证一位B站内容创作者对Claude Haiku 4.5进行了系统性的视觉编程任务测试68% 相似已验证Claude Code依托的Sonnet模型在HumanEval、SWE-bench等主流编程基准测试中持续领先67% 相似待验证Claude Sonnet 4模型在编程基准测试SWE-bench上表现优异,SWE-bench由普林斯顿大学开发67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/40311API
curl https://kongchang.com/api/v1/knowledge/claims/40311MCP
get_claim(id=40311)