Common Crawl
持续爬取互联网内容的公共数据库,自2008年起运行,已积累超过250亿个网页的原始抓取内容,是全球最大的公开网络语料库之一
核心事实
时间轴 (近 90 天)
Motif大量依赖NVIDIA开源的Nemotron预训练数据集,并辅以来自公开数据集和经过基础过滤、去重的Common Crawl处理数据的内部数据
以网页爬虫为主要来源的训练集(如Common Crawl)存在大量低质量、重复乃至虚假内容
GPTBot、ClaudeBot、Common Crawl 是已知的AI训练爬虫
据估算,Common Crawl等主流网络爬取数据集在2020年前后已基本覆盖了可公开访问的高质量英文网页
Common Crawl是AI训练中最常用的公共数据集之一,GPT系列模型及众多开源大模型均以其为重要数据来源
Common Crawl、Books3等常用预训练数据集的合规性受到质疑
域名流行度评分可以 Tranco 排名、Common Crawl 爬取频次或 DNS 查询量作为权重在索引构建阶段离线排序
大规模图像-文本数据集(如LAION-5B、Common Crawl衍生数据)主要从互联网公开资源采集,存在英语内容占主导、西方审美标准占比过高等分布不均问题
OpenBMB发布了面向LLM预训练的开放英文网页语料库UltraFineWeb,总量超过1万亿token、约11.4亿篇文档,全部来自Common Crawl并以Apache 2.0许可证开放
Common Crawl数据集包含了大量Reddit页面,是多数大模型训练的基础语料之一
还有 2 条时间轴事件
全部知识事实 (14)
Common Crawl是一个非营利组织,自2008年起持续抓取互联网内容并免费开放数据集
70%待验证整个互联网可抓取的公开网页数据(Common Crawl)约400TB
70%部分验证CCBot is the crawler for the Common Crawl project
65%待验证主流大语言模型训练语料中,英文数据占据压倒性比例,以Common Crawl等公开数据集为例,英文内容通常占总量的40%-60%,而越南语、中文等语言的占比往往不足5%
60%待验证Motif大量依赖NVIDIA开源的Nemotron预训练数据集,并辅以来自公开数据集和经过基础过滤、去重的Common Crawl处理数据的内部数据
50%待验证以网页爬虫为主要来源的训练集(如Common Crawl)存在大量低质量、重复乃至虚假内容
50%待验证GPTBot、ClaudeBot、Common Crawl 是已知的AI训练爬虫
50%待验证据估算,Common Crawl等主流网络爬取数据集在2020年前后已基本覆盖了可公开访问的高质量英文网页
50%待验证Common Crawl是AI训练中最常用的公共数据集之一,GPT系列模型及众多开源大模型均以其为重要数据来源
50%待验证Common Crawl、Books3等常用预训练数据集的合规性受到质疑
50%待验证域名流行度评分可以 Tranco 排名、Common Crawl 爬取频次或 DNS 查询量作为权重在索引构建阶段离线排序
50%待验证大规模图像-文本数据集(如LAION-5B、Common Crawl衍生数据)主要从互联网公开资源采集,存在英语内容占主导、西方审美标准占比过高等分布不均问题
50%待验证Common Crawl数据集包含了大量Reddit页面,是多数大模型训练的基础语料之一
50%待验证OpenBMB发布了面向LLM预训练的开放英文网页语料库UltraFineWeb,总量超过1万亿token、约11.4亿篇文档,全部来自Common Crawl并以Apache 2.0许可证开放
50%