持续爬取互联网内容的公共数据库,自2008年起运行,已积累超过250亿个网页的原始抓取内容,是全球最大的公开网络语料库之一
OpenBMB发布了面向LLM预训练的开放英文网页语料库UltraFineWeb,总量超过1万亿token、约11.4亿篇文档,全部来自Common Crawl并以Apache 2.0许可证开放
Common Crawl数据集包含了大量Reddit页面,是多数大模型训练的基础语料之一
Common Crawl是一个非营利组织,自2008年起持续抓取互联网内容并免费开放数据集
CCBot is the crawler for the Common Crawl project