Unverified50% confidenceFactExact time
当前主流大模型的预训练语料高度依赖公开互联网数据,包括CommonCrawl、Wikipedia、GitHub代码库等
1
Sources
50%
Confidence
Long-term
Relevance
7/11/2026
First Seen
Sources
xAI联手SpaceX训练Grok 4.5:迈向硬核工程智能新阶段
twittercursor_ai7/8/2026
Related Claims
Unverified主流LLM的训练数据中包含大量开源嵌入式代码,如GitHub上数以万计的STM32 HAL示例77% similarUnverified大模型在预训练阶段接触了海量GitHub上的diff格式数据,对该格式有极高的理解与生成能力75% similarUnverified现代大语言模型的预训练数据集通常包含数万亿 token,涵盖 GitHub 代码仓库、Stack Overflow、Linux 文档等75% similarVerified大语言模型通过在GitHub等平台上数十亿行开源代码上进行预训练,学会了编程语言的语法规则和自然语言与代码之间的映射关系75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/486679API
curl https://kongchang.com/api/v1/knowledge/claims/486679MCP
get_claim(id=486679)