Unverified50% confidenceFactExact time
MMLU、HumanEval、GSM8K等大模型评测基准存在数据污染、过拟合和生态效度不足的局限性
1
Sources
50%
Confidence
Long-term
Relevance
8/5/2026
First Seen
Sources
Related Claims
Unverified对于闭源模型,外部研究者几乎无法有效检测数据污染64% similarUnverified污点分析通过标记污点源(Source)、汇聚点(Sink)和净化函数(Sanitizer)追踪不可信数据流向以定位注入风险60% similarUnverified基准过拟合和数据污染会导致模型通过记忆而非真正理解获得高分,使公开基准分数可信度存疑60% similarUnverifiedShumailov等人2024年在Nature上发表的研究证实,即使低至千分之一的合成数据污染也能引发词汇、句法和语义多样性的可测量退化60% similarUnverified数据多样性对模型泛化能力的影响往往比数据规模更为根本,仅在特定分布上过度拟合的模型在真实部署时表现骤降60% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/687608API
curl https://kongchang.com/api/v1/knowledge/claims/687608MCP
get_claim(id=687608)