Unverified50% confidenceFactExact time
当问题过于简单、模型几乎每次都能答对时,奖励信号趋于恒定,参数更新量接近零,训练实际上停止
1
Sources
50%
Confidence
Long-term
Relevance
9/28/2026
First Seen
Sources
Related Entities
Related Claims
Unverified训练样本末尾遗漏EOS token会导致模型无法学习何时停止生成,推理时陷入无限续写76% similarUnverified训练时不能一开始就追求快,若直接压步数模型容易陷入死循环反复生成重复字符,只做第一步的版本碰上难题会卡死,需先练准再练快75% similarUnverified仅靠增大模型规模或延长训练时长并不能自动解决难题被忽视的问题,根本原因在于信号本身的缺失74% similarUnverified越接近截止日的事件,在训练语料中占比越少,模型掌握得越模糊73% similarUnverified当生成模型反复在自身生成的数据上训练时,输出分布会逐渐退化,低概率事件被系统性遗忘73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/955144API
curl https://kongchang.com/api/v1/knowledge/claims/955144MCP
get_claim(id=955144)