模型
AraBERT
由AUBMIND实验室基于BERT架构针对阿拉伯语预训练的语言模型,训练数据涵盖阿拉伯语维基百科、新闻语料等约24GB现代标准阿拉伯语文本,在阿拉伯语形态切分和语义表征方面优于多语言BERT
时间轴 (近 90 天)
10月5日
该框架的技术底座是AraBERT——一个针对阿拉伯语预训练的Transformer模型
待验证50%
10月5日
AraBERT是由AUBMIND实验室基于BERT架构针对阿拉伯语预训练的语言模型
待验证50%
10月5日
AraBERT的训练数据来源包括阿拉伯语维基百科、新闻语料等共约24GB的现代标准阿拉伯语文本
待验证50%
10月5日
相比多语言BERT(mBERT),AraBERT对阿拉伯语的形态切分和语义表征有显著优化,尤其在形态还原和词根分析方面
待验证50%