待验证50% 置信事实精确时间
孟加拉语-英语的高质量平行数据仅有数百万级别,而英法语对拥有数千万句对齐语料
1
来源数
50%
置信度
长期有效
时效性
2026/8/21
首次发现
来源
相关事实
待验证English speech datasets can reach hundreds of thousands of hours, while many Indian languages have only hundreds to thousands of hours of high-quality annotated data72% 相似待验证主流大语言模型训练语料中,英文数据占据压倒性比例,以Common Crawl等公开数据集为例,英文内容通常占总量的40%-60%,而越南语、中文等语言的占比往往不足5%70% 相似待验证手语翻译的基准数据集(如 PHOENIX-2014T、CSL-Daily、How2Sign)规模通常仅有数千到数万条样本,远小于机器翻译领域数百万句对的平行语料69% 相似待验证词库语种越多、发音质量越高,价格和体积越大;纯英语学习者选专精英语的机型比选'十国语言'的通用机型更划算,多语种机型往往每个语种的词库深度和例句都打折扣66% 相似待验证支持语言数量超过100种的机型多为营销噱头,实际小语种(如斯瓦希里语、乌尔都语)准确率往往低于60%,真正决定体验的是主流20种语言的翻译质量而非语种总数64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/784041API
curl https://kongchang.com/api/v1/knowledge/claims/784041MCP
get_claim(id=784041)