Unverified95% confidenceFactTime unknown
SWE-bench由普林斯顿大学研究团队推出,专门用于评估大语言模型解决真实软件工程问题的能力
1
Sources
95%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
SWE-bench官方博客上线:AI编程评测标准进入新阶段
twitterSWEbench
Related Entities
Related Claims
Unverified大语言模型编程场景的核心能力指标包括HumanEval代码生成基准、SWE-bench真实Bug修复成功率及跨文件依赖解析准确性67% similarUnverifiedRAG技术是目前业界公认的缓解大语言模型幻觉问题最有效的工程化方案之一64% similarUnverified该项目主要使用Shell语言编写62% similarUnverified一位Reddit开发者基于Jacobian-Lens构建了一款实验性工具,通过手动调整模型的J-Space直接改写大语言模型行为61% similarUnverifiedProject Glasswing引入了大语言模型(LLM)的语义理解能力来进行漏洞检测61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/26918API
curl https://kongchang.com/api/v1/knowledge/claims/26918MCP
get_claim(id=26918)