待验证50% 置信基准精确时间
LFM2.5在多项基准测试中展现出与体量高达其4倍模型相当的竞争力
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/13
首次发现
有效期至:2026/11/11
来源
相关事实
待验证测评者认为GLM 5.2在纯编码上依然强劲,但涉及审美、物理感和模拟质感任务时HY3更胜一筹69% 相似待验证在实际性能测试中,GLM 4.6的表现远远优于Claude 4.5 Haiku68% 相似待验证LFM2.5在模拟真实Agent场景的电信测试中提升了74个点,指令跟随IFEval达到91.8,数学推理Math500达到88.866% 相似待验证GLM4在SWE-Bench基准测试中得分46.2%,显著优于上一代模型66% 相似待验证LFM2.5 has 8.3 billion total parameters but only 1.5 billion parameters activated per inference66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/742624API
curl https://kongchang.com/api/v1/knowledge/claims/742624MCP
get_claim(id=742624)