Unverified50% confidenceFactExact time
当前主流大模型的训练数据量已达到十几T甚至六十T token
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Hyper-Connections:残差连接十年来首次重大改进
bilibili姚育平6/6/2026
Related Claims
Unverified在千亿参数大模型训练中,节点间通信开销可能占总训练时间的30%-50%72% similarUnverifiedLLaMA 1的训练数据量为1.4T token,LLaMA 2的训练数据量为2T token71% similarUnverified主流大模型的训练数据通常有6-18个月的滞后期69% similarUnverifiedMid-training(持续预训练)是介于预训练和微调之间的训练阶段,数据量通常达到数千亿到数万亿token69% similarVerified2022年DeepMind发布Chinchilla论文,修正了最优训练配比,指出在给定算力预算下模型参数量与训练token数应大致保持1:20的比例69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/53866API
curl https://kongchang.com/api/v1/knowledge/claims/53866MCP
get_claim(id=53866)