待验证50% 置信事实精确时间
LLaMA系列采用过度训练策略,以7B参数训练了1T token,远超Chinchilla最优配比的140B token
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证根据Chinchilla缩放定律,一个30B模型的最优训练数据量约为600B-1T tokens69% 相似待验证700亿参数的Chinchilla模型在1.4万亿token上训练,性能超过了2800亿参数但仅用3000亿token训练的Gopher63% 相似待验证LoRA使可训练参数量通常仅为全参微调的0.1%-1%,可在单张RTX 3090/4090(显存24GB)上微调7B乃至13B级别的模型63% 相似待验证训练7B参数模型的全参数微调通常需要至少4张A100(80G)显卡,而LoRA使单张RTX 4090(24G)完成7B量级模型微调成为可能61% 相似待验证叠加cv=5的5折交叉验证后,144种参数组合需训练144×5=720次模型58% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/893366API
curl https://kongchang.com/api/v1/knowledge/claims/893366MCP
get_claim(id=893366)