待验证85% 置信事实时间未知
在SABench基准测试中,Claude Opus 4.7得分约33分,而人类高级工程师得分80-90分
1
来源数
85%
置信度
中期 (~90 天)
时效性
2026/6/2
首次发现
有效期至:2026/8/31
来源
GPT-5.5实测3周:编程能力碾压Opus 4.7?
bilibili未来变量relaunch
涉及实体
相关事实
已验证Claude 4.5 Opus 在 SWE-Bench Verified 上达到了 80.9% 的成绩77% 相似待验证Claude Opus 4.8在智能体实战跑分中拿下1890分,比上一代高出137分,甩开GPT 5.5达121分76% 相似待验证通义千问3.6在SWE-Bench测试中得分78.8分,对比Claude Opus的80.9分75% 相似待验证Claude Opus 4.5在Anthropic内部两小时限时工程考试中得分超过了该公司历史上评估过的所有人类候选人75% 相似待验证Claude Opus 4.8 scored 69.2% on SWEBench Pro, up from Opus 4.7's 64.3%73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/38044API
curl https://kongchang.com/api/v1/knowledge/claims/38044MCP
get_claim(id=38044)