[KongchangAI]
Benchmark

Real-SWE

一种基于私有企业级代码库的AI编程能力评测基准,旨在通过使用从未公开的内部代码库规避数据污染问题,更真实地衡量模型在陌生、复杂代码环境中的推理与修复能力

Timeline (last 90 days)

Sep 12

Real-SWE 主张在私有、真实、企业级的代码库上对AI模型进行评测

Unverified50%
Sep 12

私有企业代码库从未公开,因此几乎不可能出现在模型的预训练语料中

Unverified50%
Sep 12

使用私有企业代码库天然面临可复现性的矛盾,外部研究者无法独立验证评测过程和结果

Unverified50%
Sep 12

私有数据虽然规避了污染,却也引入了不透明的新风险

Unverified50%

All Facts (4)

Source Articles