待验证50% 置信基准精确时间
SWE-bench是评估AI编程工具能力的权威基准,从真实GitHub Issue中提取任务,要求Agent自主定位代码、修复Bug并通过测试
1
来源数
50%
置信度
长期有效
时效性
2026/8/31
首次发现
来源
涉及实体
相关事实
已验证SWE-Agent是普林斯顿大学发布的研究,专注于让AI Agent自主解决GitHub上的真实软件工程问题78% 相似待验证SWE-RPG是在SWE-bench基础上发展而来的新一代AI编程能力评估框架,引入了角色扮演机制模拟不同经验水平开发者的需求提交方式76% 相似待验证Terminal-Bench 属于交互式Agent基准测试家族,与SWE-bench、WebArena等评测共同构成AI Agent能力的多维评估体系74% 相似待验证IAB(Intelligent Agent Benchmarking)workshop聚焦智能体评估70% 相似待验证SWE-bench的任务设计本质上是单次任务,Agent在干净环境中处理独立Issue,掩盖了跨会话记忆缺失的问题68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/830340API
curl https://kongchang.com/api/v1/knowledge/claims/830340MCP
get_claim(id=830340)