待验证90% 置信事实时间未知
SWE-bench Verified经过人工审核确保每个实例的质量和可解性
1
来源数
90%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
SWE-bench官方博客上线:AI编程评测标准进入新阶段
twitterSWEbench
涉及实体
相关事实
待验证SWE-bench Verified由人工标注者筛除描述模糊或测试不稳定的样本,是业界权威的AI编程能力排行榜之一77% 相似待验证SWE-Bench推出了SWE-Bench Verified和SWE-Bench Multimodal变体,前者人工筛选确保可解性,后者加入截图等多模态上下文72% 相似待验证该方案中 AI 自动评审会进行完整性检查、一致性检查和冗余检查等多维度验证71% 相似已验证SWE-bench Verified是经过人工验证的子集,约500个样本,排除了描述模糊或测试不可靠的任务70% 相似待验证评估智能体编程能力的主流基准包括SWE-bench、SWE-bench Verified和HumanEval69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/26922API
curl https://kongchang.com/api/v1/knowledge/claims/26922MCP
get_claim(id=26922)