Unverified50% confidenceBenchmarkExact time
在图片隐藏虫子识别测试中,Sonnet 5的Max模式花费约10分钟并识别结果完全正确,而Gemini顶配模型只找到4只,GPT-5.5 X-High未能检测出
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/22/2026
First Seen
Valid until: 10/20/2026
Sources
Related Claims
Unverified在智能体搜索测试中,Sonnet 5 各 effort level 下均优于 Sonnet 4.6,但整体性能低于 Opus 4.8,综合约在 Opus 4.7 级别70% similarUnverified在苏州博物馆Three.js场景任务中,Sonnet 5 Max搭配Claude官方Harness花了超过一小时仍未完成,但地面材质、盆景倒影等质感在测试过的所有模型中最好69% similarUnverified在简单题中,GLM 5.1补了19行测试,Kimi K2.6补了12行,其他五个模型(包括Sonnet 4.6)一行测试都没写66% similarUnverified本次测试选取了五款AI模型:DeepSeek R1、Claude Sonnet 3.7、ChatGPT o3 Mini、Grok 3、通义千问2.5 Max,通过统一提示词让它们各自生成可运行的网页版贪吃蛇游戏66% similarUnverified在智能体计算机使用基准中,Opus 4.8 的 high 设置与 Sonnet 5 的 max 设置表现相当,但 Sonnet 5 消耗更多 token66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/593953API
curl https://kongchang.com/api/v1/knowledge/claims/593953MCP
get_claim(id=593953)