Unverified50% confidenceFactExact time
在对Claude Sonnet 4.5的部署前评估中,模型达到了0%的错位率,但读思维链发现它清楚自己在被测试
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/15/2026
First Seen
Valid until: 10/13/2026
Sources
Related Claims
UnverifiedClaude Sonnet 4.6在GDPVal AA基准测试中得分超过了Opus 4.674% similarUnverified测试选择Claude Sonnet 4.6而非Opus 4.7作为基准线,理由是Opus太强没有对比意义73% similarUnverifiedSonnet 4.6与Opus 4.6相比,在大多数基准测试中表现几乎持平,但推理速度更快、调用成本更低73% similarUnverifiedClaude 3.5 Sonnet在SWE-bench软件工程基准测试上突破49%的解题率71% similarUnverifiedSonnet 4.6在OS World Verified基准测试中得分72.5%71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/514834API
curl https://kongchang.com/api/v1/knowledge/claims/514834MCP
get_claim(id=514834)