[控场AI]
产品Common Crawl数据库

Common Crawl

持续爬取互联网内容的公共数据库,自2008年起运行,已积累超过250亿个网页的原始抓取内容,是全球最大的公开网络语料库之一

核心事实

时间轴 (近 90 天)

10月4日

Motif大量依赖NVIDIA开源的Nemotron预训练数据集,并辅以来自公开数据集和经过基础过滤、去重的Common Crawl处理数据的内部数据

待验证50%
9月27日

以网页爬虫为主要来源的训练集(如Common Crawl)存在大量低质量、重复乃至虚假内容

待验证50%
9月26日

GPTBot、ClaudeBot、Common Crawl 是已知的AI训练爬虫

待验证50%
9月24日

据估算,Common Crawl等主流网络爬取数据集在2020年前后已基本覆盖了可公开访问的高质量英文网页

待验证50%
9月17日

Common Crawl是AI训练中最常用的公共数据集之一,GPT系列模型及众多开源大模型均以其为重要数据来源

待验证50%
9月15日

Common Crawl、Books3等常用预训练数据集的合规性受到质疑

待验证50%
9月12日

域名流行度评分可以 Tranco 排名、Common Crawl 爬取频次或 DNS 查询量作为权重在索引构建阶段离线排序

待验证50%
9月1日

大规模图像-文本数据集(如LAION-5B、Common Crawl衍生数据)主要从互联网公开资源采集,存在英语内容占主导、西方审美标准占比过高等分布不均问题

待验证50%
8月24日

OpenBMB发布了面向LLM预训练的开放英文网页语料库UltraFineWeb,总量超过1万亿token、约11.4亿篇文档,全部来自Common Crawl并以Apache 2.0许可证开放

待验证50%
8月22日

Common Crawl数据集包含了大量Reddit页面,是多数大模型训练的基础语料之一

待验证50%

还有 2 条时间轴事件

全部知识事实 (14)

已验证

Common Crawl是一个非营利组织,自2008年起持续抓取互联网内容并免费开放数据集

70%
待验证

整个互联网可抓取的公开网页数据(Common Crawl)约400TB

70%
部分验证

CCBot is the crawler for the Common Crawl project

65%
待验证

主流大语言模型训练语料中,英文数据占据压倒性比例,以Common Crawl等公开数据集为例,英文内容通常占总量的40%-60%,而越南语、中文等语言的占比往往不足5%

60%
待验证

Motif大量依赖NVIDIA开源的Nemotron预训练数据集,并辅以来自公开数据集和经过基础过滤、去重的Common Crawl处理数据的内部数据

50%
待验证

以网页爬虫为主要来源的训练集(如Common Crawl)存在大量低质量、重复乃至虚假内容

50%
待验证

GPTBot、ClaudeBot、Common Crawl 是已知的AI训练爬虫

50%
待验证

据估算,Common Crawl等主流网络爬取数据集在2020年前后已基本覆盖了可公开访问的高质量英文网页

50%
待验证

Common Crawl是AI训练中最常用的公共数据集之一,GPT系列模型及众多开源大模型均以其为重要数据来源

50%
待验证

Common Crawl、Books3等常用预训练数据集的合规性受到质疑

50%
待验证

域名流行度评分可以 Tranco 排名、Common Crawl 爬取频次或 DNS 查询量作为权重在索引构建阶段离线排序

50%
待验证

大规模图像-文本数据集(如LAION-5B、Common Crawl衍生数据)主要从互联网公开资源采集,存在英语内容占主导、西方审美标准占比过高等分布不均问题

50%
待验证

Common Crawl数据集包含了大量Reddit页面,是多数大模型训练的基础语料之一

50%
待验证

OpenBMB发布了面向LLM预训练的开放英文网页语料库UltraFineWeb,总量超过1万亿token、约11.4亿篇文档,全部来自Common Crawl并以Apache 2.0许可证开放

50%

来源文章