[KongchangAI]
Unverified50% confidenceFactExact time

SWE-bench相比HumanEval、MBPP等传统基准更贴近实际开发场景,考验模型对大型代码库的理解、跨文件依赖追踪和缺陷定位能力

1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/491138
API
curl https://kongchang.com/api/v1/knowledge/claims/491138
MCP
get_claim(id=491138)