[控场AI]
已验证65% 置信基准精确时间

GPT-4、Claude 3.5 Sonnet、Gemini 1.5 Pro等新一代大语言模型在HumanEval、SWE-bench等代码能力基准测试上的得分已大幅超越此前版本

3
来源数
65%
置信度
中期 (~90 天)
时效性
2026/7/16
首次发现
有效期至:2026/10/14

来源

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/533888
API
curl https://kongchang.com/api/v1/knowledge/claims/533888
MCP
get_claim(id=533888)