Unverified50% confidenceFactExact time
Common Crawl是非营利组织运营的大规模网络爬取项目,每月抓取数十亿网页,数据集被用于训练包括GPT系列在内的大型语言模型
1
Sources
50%
Confidence
Long-term
Relevance
8/12/2026
First Seen
Sources
Related Claims
Verified目前每周有近十亿用户使用ChatGPT进行写作、搜索、研究和创作74% similarUnverifiedCommon Crawl项目存储了超过2500亿网页的完整HTML快照,压缩后数据量达PB级别,是许多AI模型的主要训练数据来源之一71% similarVerifiedCommon Crawl自2008年起持续运行,其公开数据库已积累超过250亿个网页的原始抓取内容69% similarUnverifiedChatGPT的日常推理服务每天消耗数百万美元的GPU算力69% similarUnverified超节点算力通过高速互联网络将数千乃至数万张GPU/NPU组成统一计算池,是训练千亿至万亿参数大模型的必要基础设施67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/736887API
curl https://kongchang.com/api/v1/knowledge/claims/736887MCP
get_claim(id=736887)