Unverified50% confidenceFactExact time
SWE-bench Verified由人工标注者筛除描述模糊或测试不稳定的样本,是业界权威的AI编程能力排行榜之一
1
Sources
50%
Confidence
Long-term
Relevance
7/11/2026
First Seen
Sources
GPT-5.6发布:Codex正式集成ChatGPT,AI编程迈入新阶段
twitterOpenAIDevs7/10/2026
Related Claims
VerifiedSWE-bench Verified是经过人工验证的子集,约500个样本,排除了描述模糊或测试不可靠的任务80% similarVerifiedSWE-bench Verified经过人工审核确保每个实例的质量和可解性77% similarUnverified标准化AI基准测试(如HumanEval、SWE-bench)存在基准过拟合的失真问题74% similarUnverified该方案中 AI 自动评审会进行完整性检查、一致性检查和冗余检查等多维度验证74% similarUnverified针对AI生成代码的验证流程应包含静态分析关卡、依赖审计、测试覆盖率门禁和人工语义审查四个互补检查点74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/486184API
curl https://kongchang.com/api/v1/knowledge/claims/486184MCP
get_claim(id=486184)