待验证50% 置信基准精确时间
SWE-Bench由普林斯顿大学团队发布,从GitHub上12个真实Python开源项目抽取近2300个真实Issue,2024年初顶级模型通过率仅约4%-5%,至2025年头部模型已突破60%
1
来源数
50%
置信度
长期有效
时效性
2026/7/24
首次发现
来源
Grok 4.5深度解析:专为编程与Agent而生的工程大脑
bilibili傻狗与AI2026/7/9
相关事实
待验证SWE-Bench 由普林斯顿 NLP 团队于 2023 年提出,从 GitHub 抓取了 2294 个真实 Issue-PR 对,覆盖 12 个主流 Python 项目83% 相似待验证SWE-bench是由普林斯顿大学研究团队于2023年推出的大型语言模型编程能力评估基准,从GitHub上12个主流Python开源项目中提取了2294个任务实例80% 相似已验证SWE-Bench从GitHub上12个主流Python开源项目中收集了2294个真实的Issue-Pull Request对80% 相似已验证SWE-Bench由普林斯顿大学于2023年推出,从GitHub真实开源项目中抽取数千个已解决的Issue来评测AI编程能力79% 相似已验证SWE-bench由普林斯顿大学研究团队于2023年发布,从12个知名Python开源项目中收集了2,294个真实的GitHub Issue及其对应的Pull Request修复方案79% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/611173API
curl https://kongchang.com/api/v1/knowledge/claims/611173MCP
get_claim(id=611173)