待验证50% 置信事实精确时间
Common Crawl项目存储了超过2500亿网页的完整HTML快照,压缩后数据量达PB级别,是许多AI模型的主要训练数据来源之一
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/11
首次发现
有效期至:2026/11/9
来源
相关事实
待验证CLIP的训练数据来自互联网公开爬取的数据集WIT(WebImageText),其规模约为ImageNet(约1400万张标注图像)的近30倍78% 相似待验证现代图像生成模型的训练数据通常来自数十亿张互联网图片及其配套的文本描述76% 相似待验证Common Crawl是非营利组织运营的大规模网络爬取项目,每月抓取数十亿网页,数据集被用于训练包括GPT系列在内的大型语言模型71% 相似待验证Common Crawl是自2008年运行至今的非营利项目,截至2024年已累积超过2500亿个网页存档,数据以WARC格式存储在AWS S3上70% 相似待验证CLIP于2021年发布,通过从互联网收集的4亿个图像-文本配对数据进行训练69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/731023API
curl https://kongchang.com/api/v1/knowledge/claims/731023MCP
get_claim(id=731023)