待验证90% 置信事实时间未知
SWE-bench(Software Engineering Benchmark)是目前衡量智能体编码能力的核心基准,从真实的GitHub Issue出发要求模型自主定位代码库中的问题并提交修复补丁
1
来源数
90%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
Claude 4.5 Sonnet实测:一条指令构建完整AI视觉应用
bilibiliUltralytics
涉及实体
相关事实
引用此条事实
Stable URI
https://kongchang.com/claim/24179API
curl https://kongchang.com/api/v1/knowledge/claims/24179MCP
get_claim(id=24179)