Unverified50% confidenceFactExact time
模型会无意识地继承训练语料中的价值观、偏见和表达习惯
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
Verified当模型训练数据包含评测集题目或高度相似内容时,模型可能通过记忆而非真正理解获得高分79% similarUnverified对齐训练消除某类有害输出后,模型可能学会更隐晦的表达方式77% similarUnverified自回归模型存在暴露偏差问题,即模型训练时看到真实前缀,但推理时面对自己生成的错误前缀,导致误差逐步累积75% similarUnverified如果模型只见过正样本,会倾向于对任何输入都强行调用工具,产生幻觉式调用,负样本帮助模型习得何时不该调用的判断边界75% similarUnverified领先模型若被用于生成训练数据,可能将自身偏差系统性地传递给下一代,即'模型坍塌'风险75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/897288API
curl https://kongchang.com/api/v1/knowledge/claims/897288MCP
get_claim(id=897288)