Unverified90% confidenceFactTime unknown
SWE-bench是由普林斯顿大学研究团队于2023年推出的大型语言模型编程能力评估基准,从GitHub上12个主流Python开源项目中提取了2294个任务实例
1
Sources
90%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Rovo Agent:每天2000万免费Token,SWE-bench排名第一的AI编程CLI工具
bilibiliAI-seeker
Related Entities
Related Claims
UnverifiedSWE-Bench由普林斯顿大学团队发布,从GitHub上12个真实Python开源项目抽取近2300个真实Issue,2024年初顶级模型通过率仅约4%-5%,至2025年头部模型已突破60%80% similarUnverifiedSWE-bench由普林斯顿大学团队提出,包含2294个来自Django、Flask、Scikit-learn等12个Python开源仓库的真实GitHub Issue-Pull Request对79% similarUnverifiedSWE-Bench 由普林斯顿 NLP 团队于 2023 年提出,从 GitHub 抓取了 2294 个真实 Issue-PR 对,覆盖 12 个主流 Python 项目79% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/23479API
curl https://kongchang.com/api/v1/knowledge/claims/23479MCP
get_claim(id=23479)