Unverified50% confidenceFactExact time
大型语言模型的训练语料可能包含未正式发表的学术预印本、研究笔记等,引发数据污染问题
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
Unverified当训练数据中某些文本出现频率极高时,大语言模型可能产生记忆化(Memorization)现象,能够近乎逐字输出特定段落77% similarUnverifiedTraining data for large language models includes both authoritative sources like Wikipedia and unreliable content like forum spam and deliberate fabrications76% similarUnverified过度设计是大语言模型的常见问题,因训练数据中充斥大量架构设计文章,模型倾向输出教科书级别的复杂方案74% similarUnverified主流扩散模型的文字生成依赖CLIP等视觉-语言预训练模型,其训练数据以英文为主,导致中文字符生成困难74% similarUnverified粤语书写系统至今未完全标准化,同一口语词汇存在多种汉字写法,导致模型训练面临标签噪声问题73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/893161API
curl https://kongchang.com/api/v1/knowledge/claims/893161MCP
get_claim(id=893161)