待验证85% 置信事实时间未知
测试选择Claude Sonnet 4.6而非Opus 4.7作为基准线,理由是Opus太强没有对比意义
1
来源数
85%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
7个AI修同一个Bug实测:GLM 5.1反超Claude Sonnet详细对比
bilibili寒冰巨魔9527
涉及实体
相关事实
待验证测评选择Claude 4 Sonnet而非Claude 4.1 Opus作为对比对象,原因是大多数开发者因成本问题不会在实际场景中使用Opus80% 相似待验证Sonnet 4.6与Opus 4.6相比,在大多数基准测试中表现几乎持平,但推理速度更快、调用成本更低80% 相似待验证Claude Sonnet 4.6在GDPVal AA基准测试中得分超过了Opus 4.677% 相似待验证Sonnet 4.6在'大海捞针'测试中的表现与Opus持平77% 相似待验证在智能体搜索测试中,Sonnet 5 各 effort level 下均优于 Sonnet 4.6,但整体性能低于 Opus 4.8,综合约在 Opus 4.7 级别76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13173API
curl https://kongchang.com/api/v1/knowledge/claims/13173MCP
get_claim(id=13173)