待验证50% 置信观点精确时间
蒸馏训练的教师模型输出极少包含自我纠错示例,导致学生模型形成「强模型不犯错」的隐性信念,在校验失败时选择重复而非修正
1
来源数
50%
置信度
长期有效
时效性
2026/7/6
首次发现
来源
给开源模型加「修复层」:DeepSeek也能超越Claude Opus
bilibiliGelai_AI2026/7/5
相关事实
待验证许多开源模型继承教师模型的自信偏差,导致工具调用错误时不愿自我纠正82% 相似待验证推理模型幻觉率上升的根本原因是激励机制错位:强化学习训练使模型倾向于生成详尽、有说服力的思维链,人类评估者给予论述详尽的回答更高评分,即使其中包含事实性错误73% 相似待验证多对一映射导致教师token间的不确定性在投影到学生第一个token时被直接加和抹平,这是投影方式的固有属性而非实现错误72% 相似待验证许多学生在数学建模竞赛中失分的原因不是模型差,而是偏离了题目的核心要求71% 相似待验证阿里团队发现强化学习训练不会导致模型其他能力下降,反而会带来全面协同提升,与传统微调中的灾难性遗忘问题形成对比70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/114525API
curl https://kongchang.com/api/v1/knowledge/claims/114525MCP
get_claim(id=114525)