基准
Real-SWE
一种基于私有企业级代码库的AI编程能力评测基准,旨在通过使用从未公开的内部代码库规避数据污染问题,更真实地衡量模型在陌生、复杂代码环境中的推理与修复能力
时间轴 (近 90 天)
9月12日
Real-SWE 主张在私有、真实、企业级的代码库上对AI模型进行评测
待验证50%
9月12日
私有企业代码库从未公开,因此几乎不可能出现在模型的预训练语料中
待验证50%
9月12日
使用私有企业代码库天然面临可复现性的矛盾,外部研究者无法独立验证评测过程和结果
待验证50%
9月12日
私有数据虽然规避了污染,却也引入了不透明的新风险
待验证50%