Unverified50% confidenceBenchmarkExact time
Chinchilla以700亿参数配合1.4万亿token训练数据,在多项基准上超越了参数量是其4倍的Gopher模型
1
Sources
50%
Confidence
Long-term
Relevance
9/5/2026
First Seen
Sources
Related Entities
Related Claims
Unverified2022年Hoffman等人的Chinchilla论文重新校准了算力最优的参数-数据比例,指出此前许多大模型训练不充分67% similarUnverified根据DeepMind在2022年提出的Chinchilla缩放定律,一个700亿参数的模型需要约1.4万亿token才能达到计算最优65% similarUnverifiedMeta的LLaMA论文披露其训练数据中约67%来自Common Crawl,经过多轮过滤后仅保留原始数据的约15%64% similarUnverifiedChinchilla研究发现在固定计算预算下参数量和训练token数应按大致1:20比例匹配64% similarUnverified对LLaMA-7B所有注意力层应用r=8的LoRA,可训练参数量从70亿降至约400万,压缩比超过1750倍64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/859318API
curl https://kongchang.com/api/v1/knowledge/claims/859318MCP
get_claim(id=859318)