待验证50% 置信事实精确时间
经过RLHF对齐后的模型倾向于收敛到最安全、最高概率的输出,从而牺牲了创造性与多样性
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
相关事实
待验证RLHF本质上是在模型输出分布上施加统计偏好,而非植入真正的价值理解,导致表面对齐在面对对抗性输入时易崩塌78% 相似待验证RLMF的核心思路是优化模型如何准确表达自己对答案的把握程度,而非单纯优化模型说什么71% 相似待验证在RLHF中,如果偏好数据质量低下或存在系统性偏差,奖励模型会学到错误信号,导致模型行为偏离预期71% 相似待验证RLHF是InstructGPT和ChatGPT能力跃升的核心技术,但存在奖励模型被过度优化(reward hacking)的内在风险71% 相似待验证RLHF机制存在结构性偏置,任务已完成比任务存在问题更容易获得正向反馈,使模型倾向报告积极结果70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/503932API
curl https://kongchang.com/api/v1/knowledge/claims/503932MCP
get_claim(id=503932)