Unverified50% confidenceFactExact time
训练数据污染是AI编程基准测试面临的首要挑战,测试用例来自公开GitHub仓库而这些正是大模型预训练语料来源
1
Sources
50%
Confidence
Long-term
Relevance
7/10/2026
First Seen
Sources
OpenAI弃用SWE-Bench Pro:AI编程评测的信任危机与未来走向
hackernewshackernews7/8/2026
Related Claims
Verified专用编程模型的训练数据来源包括GitHub开源代码、编程竞赛题解、技术文档、代码审查记录等,并针对HumanEval、MBPP、SWE-bench等基准测试进行优化77% similarUnverified数据污染问题源于LLM预训练语料来自Common Crawl等大规模网络爬取,可能包含公开的基准测试题目及答案75% similarUnverified《AI行政令》要求训练算力超过10²⁶次浮点运算(FLOP)的模型开发商向联邦政府报告安全测试结果72% similarUnverified当前AI模型评测主要依赖标准化基准测试(如MMLU、HumanEval、GSM8K等),但存在数据污染风险和与实际应用脱节的问题71% similarUnverified当前主流AI测试工具包括GitHub Copilot、Testim、Applitools等,其底层原理是基于大语言模型(LLM)的代码生成与模式识别71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/465779API
curl https://kongchang.com/api/v1/knowledge/claims/465779MCP
get_claim(id=465779)