Unverified50% confidenceOpinionExact time
SWE-bench评估模型解决真实GitHub Issue的能力,被认为比HumanEval更贴近Agent实际工作场景
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
开源AI助手对接OpenClaw龙虾实战:本地智能体配置全流程
bilibili枫影剑wind7/4/2026
Related Claims
UnverifiedSWE-bench要求模型从真实GitHub Issue出发自主完成代码修改并通过测试用例,比HumanEval更接近真实工程场景82% similarUnverifiedSWE-bench要求模型解决GitHub上真实的软件缺陷,是评估Agent级编程能力的权威基准82% similarUnverifiedSWE-bench从真实GitHub Issues中提取任务,要求模型修复主流开源项目的真实Bug,被视为衡量实际解决工程问题能力的黄金标准76% similarUnverifiedGitHub的实践经验表明,人机协作模式(Agent提供建议由开发者审核确认)优于全自动化修复76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/115479API
curl https://kongchang.com/api/v1/knowledge/claims/115479MCP
get_claim(id=115479)