Unverified50% confidenceFactExact time
SWE-bench要求模型从真实GitHub Issue出发自主完成代码修改并通过测试用例,比HumanEval更接近真实工程场景
1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen
Sources
阿里禁用Claude Code:AI编程工具安全与数据主权之争
bilibiliSynthMindX7/4/2026
Related Claims
VerifiedSWE-bench直接使用真实的GitHub Issue作为测试题目,要求模型在完整代码仓库中定位并修复Bug82% similarUnverifiedSWE-bench评估模型解决真实GitHub Issue的能力,被认为比HumanEval更贴近Agent实际工作场景82% similarUnverifiedSWE-bench要求模型解决GitHub上真实的软件缺陷,是评估Agent级编程能力的权威基准80% similarUnverifiedSWE-bench从主流Python开源项目提取真实GitHub Issue,要求模型生成能通过官方测试套件的代码补丁79% similarUnverifiedSWE-bench要求模型在真实GitHub仓库中定位问题并生成可通过CI测试的补丁,以Resolve Rate作为核心指标77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/489178API
curl https://kongchang.com/api/v1/knowledge/claims/489178MCP
get_claim(id=489178)