待验证70% 置信事实精确时间
主流大语言模型训练语料库中英语内容通常超过50%,导致非英语语言表现存在显著差距
2
来源数
70%
置信度
长期有效
时效性
2026/5/25
首次发现
来源
OpenAI与巴西媒体巨头Grupo Folha和Grupo UOL达成内容合作
rss2026/5/25
涉及实体
相关事实
待验证主流大语言模型训练语料中,英文数据占据压倒性比例,以Common Crawl等公开数据集为例,英文内容通常占总量的40%-60%,而越南语、中文等语言的占比往往不足5%81% 相似已验证当前主流大模型训练数据中英语语料占比较高,可能导致模型在音节边界处理和停顿节奏上偏向英语韵律模式,产生外国口音76% 相似待验证当前主流大模型大多以英语为中心进行训练,对德语等形态复杂语种支持常常不够理想73% 相似待验证Common Crawl等通用语料库中英语占比通常超过45%,而葡萄牙语不足2%73% 相似待验证主流扩散模型的文字生成依赖CLIP等视觉-语言预训练模型,其训练数据以英文为主,导致中文字符生成困难72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/2166API
curl https://kongchang.com/api/v1/knowledge/claims/2166MCP
get_claim(id=2166)