待验证50% 置信基准精确时间
Chinchilla以700亿参数配合1.4万亿token训练数据,在多项基准上超越了参数量是其4倍的Gopher模型
1
来源数
50%
置信度
长期有效
时效性
2026/9/5
首次发现
来源
涉及实体
相关事实
待验证2022年Hoffman等人的Chinchilla论文重新校准了算力最优的参数-数据比例,指出此前许多大模型训练不充分67% 相似待验证根据DeepMind在2022年提出的Chinchilla缩放定律,一个700亿参数的模型需要约1.4万亿token才能达到计算最优65% 相似待验证Meta的LLaMA论文披露其训练数据中约67%来自Common Crawl,经过多轮过滤后仅保留原始数据的约15%64% 相似待验证Chinchilla研究发现在固定计算预算下参数量和训练token数应按大致1:20比例匹配64% 相似待验证对LLaMA-7B所有注意力层应用r=8的LoRA,可训练参数量从70亿降至约400万,压缩比超过1750倍64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/859318API
curl https://kongchang.com/api/v1/knowledge/claims/859318MCP
get_claim(id=859318)