待验证50% 置信基准精确时间
在苏州博物馆Three.js场景任务中,Sonnet 5 Max搭配Claude官方Harness花了超过一小时仍未完成,但地面材质、盆景倒影等质感在测试过的所有模型中最好
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/22
首次发现
有效期至:2026/10/20
来源
相关事实
待验证在图片隐藏虫子识别测试中,Sonnet 5的Max模式花费约10分钟并识别结果完全正确,而Gemini顶配模型只找到4只,GPT-5.5 X-High未能检测出69% 相似待验证Claude Haiku 4.5在部分计算机使用任务基准测试中超越了更大型的Sonnet 4.568% 相似待验证在规划任务测试中,Sonnet产出了比Haiku长三到四倍的规划文件68% 相似待验证开启Max Effort模式时Sonnet 5的Token消耗速度几乎赶上Opus,失去其原本的速度与成本优势67% 相似待验证在智能体搜索测试中,Sonnet 5 各 effort level 下均优于 Sonnet 4.6,但整体性能低于 Opus 4.8,综合约在 Opus 4.7 级别63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/593955API
curl https://kongchang.com/api/v1/knowledge/claims/593955MCP
get_claim(id=593955)