已验证65% 置信事实精确时间
Common Crawl是一个非营利组织,自2008年起持续抓取互联网内容并免费开放数据集
3
来源数
65%
置信度
长期有效
时效性
2026/8/4
首次发现
来源
相关事实
已验证Common Crawl自2008年起持续运行,其公开数据库已积累超过250亿个网页的原始抓取内容75% 相似待验证Common Crawl是自2008年运行至今的非营利项目,截至2024年已累积超过2500亿个网页存档,数据以WARC格式存储在AWS S3上73% 相似待验证Common Crawl是非营利组织运营的大规模网络爬取项目,每月抓取数十亿网页,数据集被用于训练包括GPT系列在内的大型语言模型66% 相似待验证整个互联网可抓取的公开网页数据(Common Crawl)约400TB60% 相似待验证Tranco List是综合多个排名榜单生成的去重域名列表,Common Crawl是非营利组织维护的数十亿网页爬取数据集56% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/682156API
curl https://kongchang.com/api/v1/knowledge/claims/682156MCP
get_claim(id=682156)