待验证50% 置信事实时间未知
Claude Haiku 4.5在5个编程任务测试中全部失败
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
Claude Haiku 4.5 Real-World Test: Failed All 5 Programming Tasks
bilibilikarminski-牙医
相关事实
待验证独立测试者对Claude 4.5 Haiku的测试反复运行了超过五次,结果始终表现不佳80% 相似待验证Claude Haiku 4.5在鞭炮连锁爆炸测试中6次测试均未能实现连锁爆炸效果77% 相似待验证Claude Haiku 4.5在部分计算机使用任务基准测试中超越了更大型的Sonnet 4.570% 相似待验证Claude Haiku 4.5的错误拒绝率低于Sonnet 4.5和Opus 4.1,是Anthropic迄今最安全的模型之一66% 相似待验证在独立测试者的综合排名中,Claude 4.5 Haiku分别排在第34和第37位,是主流AI实验室新一代模型中得分最低的一个65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/54458API
curl https://kongchang.com/api/v1/knowledge/claims/54458MCP
get_claim(id=54458)