Unverified50% confidenceOpinionExact time
蒸馏训练的教师模型输出极少包含自我纠错示例,导致学生模型形成「强模型不犯错」的隐性信念,在校验失败时选择重复而非修正
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
给开源模型加「修复层」:DeepSeek也能超越Claude Opus
bilibiliGelai_AI7/5/2026
Related Claims
Unverified许多开源模型继承教师模型的自信偏差,导致工具调用错误时不愿自我纠正82% similarUnverified推理模型幻觉率上升的根本原因是激励机制错位:强化学习训练使模型倾向于生成详尽、有说服力的思维链,人类评估者给予论述详尽的回答更高评分,即使其中包含事实性错误73% similarUnverified多对一映射导致教师token间的不确定性在投影到学生第一个token时被直接加和抹平,这是投影方式的固有属性而非实现错误72% similarUnverified许多学生在数学建模竞赛中失分的原因不是模型差,而是偏离了题目的核心要求71% similarUnverified阿里团队发现强化学习训练不会导致模型其他能力下降,反而会带来全面协同提升,与传统微调中的灾难性遗忘问题形成对比70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/114525API
curl https://kongchang.com/api/v1/knowledge/claims/114525MCP
get_claim(id=114525)