Unverified50% confidenceCautionExact time
模型在训练过程中学习到的目标往往与人类真正期望的价值观和行为准则存在偏差
1
Sources
50%
Confidence
Long-term
Relevance
9/5/2026
First Seen
Sources
Related Entities
Related Claims
Unverified古德哈特定律指出当一个指标成为目标本身它就不再是好指标,测试集引入训练数据会导致模型考试成绩与真实能力脱钩77% similarUnverified推理模型幻觉率上升的根本原因是激励机制错位:强化学习训练使模型倾向于生成详尽、有说服力的思维链,人类评估者给予论述详尽的回答更高评分,即使其中包含事实性错误74% similarUnverified仅凭人类演示训练出的初始策略上限被人类玩家的认知偏见和习惯性操作模式所锁定,突破人类水平来自大规模自对弈72% similarUnverified模型调用会带来不可预测性,即使技能完美契合任务模型也可能选择不调用它71% similarUnverified在机器人学习研究中,训练失败时研究者通常首先怀疑模型架构或超参数选择,而数据质量问题往往是最后才被排查到的因素70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/862076API
curl https://kongchang.com/api/v1/knowledge/claims/862076MCP
get_claim(id=862076)