待验证95% 置信事实时间未知
SWE-bench的测试数据来自Django、scikit-learn、sympy等知名开源项目的真实bug修复记录
1
来源数
95%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
SWE-bench官方博客上线:AI编程评测标准进入新阶段
twitterSWEbench
涉及实体
相关事实
待验证SWE-bench从Django、Flask、Scikit-learn等真实开源项目中抽取历史Issue和对应的修复Pull Request作为测试用例83% 相似待验证Sentry 专注于应用层错误追踪,能捕获异常堆栈、面包屑日志和用户上下文62% 相似待验证RAG通过持续更新的外部知识库缓解知识截止问题,且每个回答可附带来源文档提升可验证性59% 相似待验证软件组成分析(SCA)工具如Snyk、Dependabot、Trivy、Grype、Black Duck通过监控CVE数据库、OSV数据库和安全公告与项目依赖清单比对生成告警58% 相似待验证RAGAS是广泛使用的RAG评估开源框架,由explodinggradients团队开发,包含忠实度、答案相关性、上下文精确率和上下文召回率四个核心指标58% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/26923API
curl https://kongchang.com/api/v1/knowledge/claims/26923MCP
get_claim(id=26923)