Unverified50% confidenceTradeoffExact time
跨域微调时学习率过大会破坏预训练权重,过小则几乎学不动,需权衡设置
1
Sources
50%
Confidence
Long-term
Relevance
7/16/2026
First Seen
Sources
Related Claims
Unverified学习率决定每步迈多大,太大会越过谷底导致发散,太小则耗时极长83% similarUnverified行为克隆将问题简化为监督学习,但存在分布偏移问题,导致训练时和执行时状态分布不同引发误差累积78% similarUnverified在稠密检索中,批内负样本训练要求批次包含有信息量的负样本,随机采样会导致训练损失快速收敛但泛化性能差78% similarUnverified实验表明,仅经过数代自我训练,模型输出的方差就会急剧缩小,文本趋于同质化77% similarUnverified朴素训练后量化会导致单个权重误差在多层网络中累积放大,即复合误差,在2位或1位精度下模型结构会崩溃77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/527174API
curl https://kongchang.com/api/v1/knowledge/claims/527174MCP
get_claim(id=527174)