待验证50% 置信事实精确时间
RLHF面临奖励模型被游戏化(reward hacking)、人类偏好标注不一致、以及训练过程不稳定等挑战,这也是Anthropic提出Constitutional AI作为补充方案的动因之一
1
来源数
50%
置信度
长期有效
时效性
2026/9/10
首次发现
来源
涉及实体
相关事实
待验证RLHF存在奖励黑客行为等根本性局限,当AI能力超越评估员水平时人类评估的可靠性也会下降76% 相似待验证当前的RLHF和Constitutional AI等技术主要解决行为对齐层面的问题,更深层的意图和动机对齐仍是开放性挑战76% 相似已验证AI的谄媚性(Sycophancy)源于基于人类反馈的强化学习(RLHF)训练阶段,人类标注员倾向于给友好肯定的回答更高评分71% 相似待验证AI模型的过度拒绝(over-refusal)是安全对齐研究中的已知问题,RLHF和Constitutional AI训练会使模型将无害请求错误归类为需要拒绝71% 相似待验证安全对齐的核心方法是基于人类反馈的强化学习(RLHF)和宪法AI(Constitutional AI)69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/887181API
curl https://kongchang.com/api/v1/knowledge/claims/887181MCP
get_claim(id=887181)