Unverified50% confidenceBenchmarkExact time
SWE-bench评估模型解决真实GitHub issue的能力,LiveCodeBench使用竞赛编程题目防止数据泄露
1
Sources
50%
Confidence
Long-term
Relevance
8/13/2026
First Seen
Sources
Related Claims
UnverifiedSWE-bench使用真实GitHub Issue评测代码能力,但仍是离线静态评估,无法模拟真实Agent任务中的网络延迟、API变更等动态因素77% similarVerifiedSWE-bench直接使用真实的GitHub Issue作为测试题目,要求模型在完整代码仓库中定位并修复Bug76% similarUnverifiedSWE-bench要求模型从真实GitHub Issue出发自主完成代码修改并通过测试用例,比HumanEval更接近真实工程场景75% similarUnverifiedSWE-bench要求模型解决GitHub上真实的软件缺陷,是评估Agent级编程能力的权威基准74% similarUnverifiedSWE-bench评估模型解决真实GitHub Issue的能力,被认为比HumanEval更贴近Agent实际工作场景74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/741001API
curl https://kongchang.com/api/v1/knowledge/claims/741001MCP
get_claim(id=741001)