Unverified50% confidenceSolutionExact time
温度缩放通过在softmax之前将logit值除以可学习的标量参数T来校准模型,T大于1软化概率分布,T小于1使分布更尖锐,无需重新训练主模型
1
Sources
50%
Confidence
Long-term
Relevance
9/29/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedSoftmax函数具有平移不变性,任意放大所有logit的尺度不改变预测类别,却会将输出概率压向极端值,是其天然的过度自信倾向69% similarUnverifiedSoftmax输出的概率值并不等同于真实的贝叶斯后验概率,而是被过度优化以拉开类别间距,导致预测概率系统性偏高68% similarUnverified温度超参数τ越小分布越集中,模型对难负样本越敏感,但τ过小会导致梯度对异常值敏感、训练不稳定67% similarUnverifiedHinton在原始论文中引入温度参数T来控制概率分布的柔软程度,T越高分布越平滑,类间相似关系暴露越充分,这些类间关系被称为暗知识(Dark Knowledge)66% similarVerified温度参数越高,Softmax输出的概率分布越平坦,输出越富有创意和多样性;温度越低分布越尖锐,输出越确定保守64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/958811API
curl https://kongchang.com/api/v1/knowledge/claims/958811MCP
get_claim(id=958811)