待验证50% 置信事实精确时间
DeepSuite基准测试的误报率为44.9%,漏报率为1.2%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
Frontier Code深度解析:代码能跑≠能合并,编程基准测试迎来质量革命
bilibili烟神殿副殿主2026/6/9
相关事实
待验证SWE-Bench Pro的假阳性率为8.5%,假阴性率高达24%;而DeepSWE的假阳性率仅为0.3%,假阴性率仅为1.1%69% 相似待验证测试的准确率数据在n=100样本量下误差约为±8-10个百分点(基于95%置信水平的二项分布置信区间)68% 相似待验证根据LongMEM Eval基准测试,AgentMemory的检索准确率达到95.2%,比同类项目Mem0高出27个百分点65% 相似待验证INT8量化约损失0.5%精度、显存减半,INT4量化显存压缩至原来的1/4、精度损失约1-3%64% 相似待验证从 High 到 Max 推理档位的边际收益递减明显:DeepSWE 分数仅提升约 4 个百分点,成本却增加约 1.5 倍64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/49047API
curl https://kongchang.com/api/v1/knowledge/claims/49047MCP
get_claim(id=49047)