Verified65% confidenceFactTime unknown
2024年初时,最强AI模型在SWE-Bench上的得分仅在10%-20%区间
3
Sources
65%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Gemini 3 Flash深度评测:编码、多模态、写作全面实测
bilibilikate人不错
Related Entities
Related Claims
UnverifiedSWE-bench Verified上的AI通过率在一年前还不到40%,截至2025年中已超过72%76% similarUnverified在SWE-bench Full版本上,多数模型的通过率仍低于20%75% similarUnverified2023年初主流模型的SWE-bench得分普遍低于5%,到2025年中顶级模型已突破70%74% similarUnverified2024年普林斯顿大学研究表明,经过GEO优化的内容被AI引用的概率可提升40%以上71% similarUnverified麦肯锡2024年调研显示,真正能够精确衡量AI ROI的企业不足25%70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/19989API
curl https://kongchang.com/api/v1/knowledge/claims/19989MCP
get_claim(id=19989)