共 1 篇相关文章
OpenAI宣布不再推荐SWE-Bench Pro作为AI编程评测基准,折射出数据污染、指标局限等深层问题。本文深入解析AI代码生成能力评测的信任危机成因,以及动态测试、质量评估等新一代评测范式的发展趋势。