Verified70% confidenceFactTime unknown
SWE-bench Verified是经过人工验证的子集,约500个样本,排除了描述模糊或测试不可靠的任务
4
Sources
70%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Qwen在SWE-bench持续领跑:开源AI编程模型的崛起
twitterSWEbench
Related Entities
Related Claims
UnverifiedSWE-bench Verified由人工标注者筛除描述模糊或测试不稳定的样本,是业界权威的AI编程能力排行榜之一80% similarUnverified2024 年推出的 SWE-bench Verified 子集由人工筛选了 500 个高质量样本78% similarVerifiedSWE-bench Verified经过人工审核确保每个实例的质量和可解性70% similarUnverified作者检查了约1500次检测调用,手动挖掘误报、调整边界框后重新训练模型67% similarUnverifiedUltra Review的验证阶段在测试中驳回了至少9个误报Bug65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/26932API
curl https://kongchang.com/api/v1/knowledge/claims/26932MCP
get_claim(id=26932)