待验证80% 置信观点时间未知
测试者认为Claude Haiku 4.5在3D建模理解、代码性能优化、库引用准确性、物理逻辑推理、指令遵循能力五个维度均表现为差或极差
1
来源数
80%
置信度
中期 (~90 天)
时效性
2026/6/3
首次发现
有效期至:2026/9/1
来源
Claude Haiku 4.5实测:5项编程任务全面翻车
bilibilikarminski-牙医
涉及实体
相关事实
待验证B站UP主通过5项可视化编程任务对Claude Haiku 4.5进行了系统性测试,结果全部表现不佳81% 相似待验证Claude Haiku 4.5生成的大象牙膏动画代码存在严重性能瓶颈,运行时特别卡顿68% 相似待验证Claude 4.5 Haiku的设计目标是将推理延迟压缩到亚秒级别,同时将每次调用的token成本降至大型模型的几分之一67% 相似待验证量化并非无损压缩,精度越低模型推理质量(困惑度、逻辑推理能力)会有不同程度下降,4-bit量化被认为是质量与体积的较好平衡点65% 相似待验证Haiku 4.5在安全评估中的错位行为(misalignment behavior)发生率在所有模型中最低。65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/40310API
curl https://kongchang.com/api/v1/knowledge/claims/40310MCP
get_claim(id=40310)