待验证50% 置信事实精确时间
Mainstream benchmarks like SWE-Bench Pro heavily rely on issues and commits from public repositories, creating data contamination risk for models trained on public GitHub code.
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
DeepSWE Benchmark Reveals the Truth: GPT 5.5 Leads Opus 4.7 by a Wide Margin
bilibili7k的每日搬运2026/5/29
相关事实
待验证SWE-bench评估模型解决真实GitHub issue的能力,LiveCodeBench使用竞赛编程题目防止数据泄露71% 相似待验证数据污染问题源于大模型在包含 GitHub、Stack Overflow、LeetCode 等平台公开代码题解的语料上进行预训练70% 相似待验证SWE-bench(Software Engineering Benchmark)是目前衡量智能体编码能力的核心基准,从真实的GitHub Issue出发要求模型自主定位代码库中的问题并提交修复补丁68% 相似待验证GitHub Actions 存在平台绑定问题,国内开发者使用 GitHub 托管 Runner 面临网络访问不稳定的风险68% 相似待验证GitHub Copilot生成代码中常见的安全问题包括SQL注入、跨站脚本攻击(XSS)和不安全的随机数生成67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/46950API
curl https://kongchang.com/api/v1/knowledge/claims/46950MCP
get_claim(id=46950)