Unverified50% confidenceFactExact time
Grokking指模型在训练集上早已达到近乎完美拟合后,测试集性能长时间停留在随机水平,直到经过大量额外训练步数后泛化能力才突然提升的现象
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
Unverified实验表明按由易到难顺序喂给模型训练样本能加速收敛并学到更鲁棒的特征表示,性能优于随机打乱顺序的训练77% similarUnverified微调训练过程中需要同时保存模型权重、梯度、优化器状态,显存消耗通常是推理时的 3-4 倍72% similarUnverified深度学习训练存在固有随机性,相同配置下重新训练结果未必相同,随机性来源包括权重初始化随机种子、数据批次打乱顺序、Dropout引入的随机噪声及分布式训练中浮点运算的非确定性累积误差71% similarUnverified小版本号跃迁通常对应后训练(Post-Training)阶段的优化,而非预训练的重新训练70% similarUnverified非均匀张量并行以局部性能的适度牺牲换取全局训练的连续性,避免昂贵的检查点回滚70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/916327API
curl https://kongchang.com/api/v1/knowledge/claims/916327MCP
get_claim(id=916327)