待验证50% 置信基准精确时间
即便是当前最先进的模型如GLM-5.2、Claude-Sonnet-4.6和GPT在该基准上表现也仅过半
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/11
首次发现
有效期至:2026/12/10
来源
涉及实体
相关事实
待验证GLM-5.2、Claude-Sonnet-4.6和GPT-5等最先进模型在困难子集上的Pass@8仅达到约50-54%79% 相似待验证据实测评价,GLM-5.2的综合表现已达到GPT-5.x和Claude系列旗舰模型的水平线79% 相似待验证早期GPT-4在SWE-bench上的解决率不足2%,而近期顶尖模型已突破50%78% 相似待验证早期GPT-3的HumanEval Pass@1不足10%,而GPT-4o、Claude 3.5 Sonnet等顶尖模型已稳定超过85%77% 相似部分验证GPT-5.6 是对 GPT-5.5 的明显提升,但尚未达到「跨代」的程度,没有解决模型原本的弱项77% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/895643API
curl https://kongchang.com/api/v1/knowledge/claims/895643MCP
get_claim(id=895643)