待验证50% 置信事实精确时间
训练数据污染是AI编程基准测试面临的首要挑战,测试用例来自公开GitHub仓库而这些正是大模型预训练语料来源
1
来源数
50%
置信度
长期有效
时效性
2026/7/10
首次发现
来源
OpenAI弃用SWE-Bench Pro:AI编程评测的信任危机与未来走向
hackernewshackernews2026/7/8
相关事实
已验证专用编程模型的训练数据来源包括GitHub开源代码、编程竞赛题解、技术文档、代码审查记录等,并针对HumanEval、MBPP、SWE-bench等基准测试进行优化77% 相似待验证数据污染问题源于LLM预训练语料来自Common Crawl等大规模网络爬取,可能包含公开的基准测试题目及答案75% 相似待验证《AI行政令》要求训练算力超过10²⁶次浮点运算(FLOP)的模型开发商向联邦政府报告安全测试结果72% 相似待验证当前AI模型评测主要依赖标准化基准测试(如MMLU、HumanEval、GSM8K等),但存在数据污染风险和与实际应用脱节的问题71% 相似待验证当前主流AI测试工具包括GitHub Copilot、Testim、Applitools等,其底层原理是基于大语言模型(LLM)的代码生成与模式识别71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/465779API
curl https://kongchang.com/api/v1/knowledge/claims/465779MCP
get_claim(id=465779)