Unverified50% confidenceBenchmarkExact time
SWE-bench是评估AI编程工具能力的权威基准,从真实GitHub Issue中提取任务,要求Agent自主定位代码、修复Bug并通过测试
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
VerifiedSWE-Agent是普林斯顿大学发布的研究,专注于让AI Agent自主解决GitHub上的真实软件工程问题78% similarUnverifiedSWE-RPG是在SWE-bench基础上发展而来的新一代AI编程能力评估框架,引入了角色扮演机制模拟不同经验水平开发者的需求提交方式76% similarUnverifiedTerminal-Bench 属于交互式Agent基准测试家族,与SWE-bench、WebArena等评测共同构成AI Agent能力的多维评估体系74% similarUnverifiedIAB(Intelligent Agent Benchmarking)workshop聚焦智能体评估70% similarUnverifiedSWE-bench的任务设计本质上是单次任务,Agent在干净环境中处理独立Issue,掩盖了跨会话记忆缺失的问题68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/830340API
curl https://kongchang.com/api/v1/knowledge/claims/830340MCP
get_claim(id=830340)