已验证65% 置信基准精确时间
GPT-4、Claude 3.5 Sonnet、Gemini 1.5 Pro等新一代大语言模型在HumanEval、SWE-bench等代码能力基准测试上的得分已大幅超越此前版本
3
来源数
65%
置信度
中期 (~90 天)
时效性
2026/7/16
首次发现
有效期至:2026/10/14
来源
相关事实
引用此条事实
Stable URI
https://kongchang.com/claim/533888API
curl https://kongchang.com/api/v1/knowledge/claims/533888MCP
get_claim(id=533888)