待验证50% 置信事实精确时间
Grokking指模型在训练集上早已达到近乎完美拟合后,测试集性能长时间停留在随机水平,直到经过大量额外训练步数后泛化能力才突然提升的现象
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证实验表明按由易到难顺序喂给模型训练样本能加速收敛并学到更鲁棒的特征表示,性能优于随机打乱顺序的训练77% 相似待验证微调训练过程中需要同时保存模型权重、梯度、优化器状态,显存消耗通常是推理时的 3-4 倍72% 相似待验证深度学习训练存在固有随机性,相同配置下重新训练结果未必相同,随机性来源包括权重初始化随机种子、数据批次打乱顺序、Dropout引入的随机噪声及分布式训练中浮点运算的非确定性累积误差71% 相似待验证小版本号跃迁通常对应后训练(Post-Training)阶段的优化,而非预训练的重新训练70% 相似待验证非均匀张量并行以局部性能的适度牺牲换取全局训练的连续性,避免昂贵的检查点回滚70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/916327API
curl https://kongchang.com/api/v1/knowledge/claims/916327MCP
get_claim(id=916327)