待验证50% 置信事实精确时间
大型语言模型的训练语料可能包含未正式发表的学术预印本、研究笔记等,引发数据污染问题
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证当训练数据中某些文本出现频率极高时,大语言模型可能产生记忆化(Memorization)现象,能够近乎逐字输出特定段落77% 相似待验证Training data for large language models includes both authoritative sources like Wikipedia and unreliable content like forum spam and deliberate fabrications76% 相似待验证过度设计是大语言模型的常见问题,因训练数据中充斥大量架构设计文章,模型倾向输出教科书级别的复杂方案74% 相似待验证主流扩散模型的文字生成依赖CLIP等视觉-语言预训练模型,其训练数据以英文为主,导致中文字符生成困难74% 相似待验证粤语书写系统至今未完全标准化,同一口语词汇存在多种汉字写法,导致模型训练面临标签噪声问题73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/893161API
curl https://kongchang.com/api/v1/knowledge/claims/893161MCP
get_claim(id=893161)