Unverified50% confidenceFactExact time
DeepSuite基准测试的误报率为44.9%,漏报率为1.2%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Frontier Code深度解析:代码能跑≠能合并,编程基准测试迎来质量革命
bilibili烟神殿副殿主6/9/2026
Related Claims
UnverifiedSWE-Bench Pro的假阳性率为8.5%,假阴性率高达24%;而DeepSWE的假阳性率仅为0.3%,假阴性率仅为1.1%69% similarUnverified测试的准确率数据在n=100样本量下误差约为±8-10个百分点(基于95%置信水平的二项分布置信区间)68% similarUnverified根据LongMEM Eval基准测试,AgentMemory的检索准确率达到95.2%,比同类项目Mem0高出27个百分点65% similarUnverifiedINT8量化约损失0.5%精度、显存减半,INT4量化显存压缩至原来的1/4、精度损失约1-3%64% similarUnverified从 High 到 Max 推理档位的边际收益递减明显:DeepSWE 分数仅提升约 4 个百分点,成本却增加约 1.5 倍64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/49047API
curl https://kongchang.com/api/v1/knowledge/claims/49047MCP
get_claim(id=49047)