待验证50% 置信事实精确时间
Tranco List是综合多个排名榜单生成的去重域名列表,Common Crawl是非营利组织维护的数十亿网页爬取数据集
1
来源数
50%
置信度
长期有效
时效性
2026/8/20
首次发现
来源
相关事实
已验证Common Crawl自2008年起持续运行,其公开数据库已积累超过250亿个网页的原始抓取内容65% 相似待验证Common Crawl是自2008年运行至今的非营利项目,截至2024年已累积超过2500亿个网页存档,数据以WARC格式存储在AWS S3上59% 相似待验证Exa持续爬取并索引数十亿网页,将内容预先向量化存储59% 相似待验证Common Crawl是非营利组织运营的大规模网络爬取项目,每月抓取数十亿网页,数据集被用于训练包括GPT系列在内的大型语言模型58% 相似已验证Common Crawl是一个非营利组织,自2008年起持续抓取互联网内容并免费开放数据集56% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/780111API
curl https://kongchang.com/api/v1/knowledge/claims/780111MCP
get_claim(id=780111)