Unverified50% confidenceFactTime unknown
Claude Haiku 4.5在5个编程任务测试中全部失败
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Claude Haiku 4.5 Real-World Test: Failed All 5 Programming Tasks
bilibilikarminski-牙医
Related Claims
Unverified独立测试者对Claude 4.5 Haiku的测试反复运行了超过五次,结果始终表现不佳80% similarUnverifiedClaude Haiku 4.5在鞭炮连锁爆炸测试中6次测试均未能实现连锁爆炸效果77% similarUnverifiedClaude Haiku 4.5在部分计算机使用任务基准测试中超越了更大型的Sonnet 4.570% similarUnverifiedClaude Haiku 4.5的错误拒绝率低于Sonnet 4.5和Opus 4.1,是Anthropic迄今最安全的模型之一66% similarUnverified在独立测试者的综合排名中,Claude 4.5 Haiku分别排在第34和第37位,是主流AI实验室新一代模型中得分最低的一个65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/54458API
curl https://kongchang.com/api/v1/knowledge/claims/54458MCP
get_claim(id=54458)