Verified65% confidenceFactExact time
Common Crawl是一个非营利组织,自2008年起持续抓取互联网内容并免费开放数据集
3
Sources
65%
Confidence
Long-term
Relevance
8/4/2026
First Seen
Sources
Related Claims
VerifiedCommon Crawl自2008年起持续运行,其公开数据库已积累超过250亿个网页的原始抓取内容75% similarUnverifiedCommon Crawl是自2008年运行至今的非营利项目,截至2024年已累积超过2500亿个网页存档,数据以WARC格式存储在AWS S3上73% similarUnverifiedCommon Crawl是非营利组织运营的大规模网络爬取项目,每月抓取数十亿网页,数据集被用于训练包括GPT系列在内的大型语言模型66% similarUnverified整个互联网可抓取的公开网页数据(Common Crawl)约400TB60% similarUnverifiedTranco List是综合多个排名榜单生成的去重域名列表,Common Crawl是非营利组织维护的数十亿网页爬取数据集56% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/682156API
curl https://kongchang.com/api/v1/knowledge/claims/682156MCP
get_claim(id=682156)