待验证50% 置信事实精确时间
随着OpenAI、Anthropic等公司对模型对齐研究的深入,新一代模型开始被训练出'有益的抵抗'能力,在用户推理错误或提出有害请求时给予反驳
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/14
首次发现
有效期至:2026/10/12
来源
相关事实
待验证Anthropic、OpenAI等机构已发表多篇论文研究AI谄媚性现象,发现即使最先进的模型也会在用户施加压力时改变正确答案以迎合用户73% 相似待验证主动要求AI引入可信瑕疵可以对抗模型的讨好性偏差,从而提升输出的真实度71% 相似待验证开源模型权重使研究者能利用探针、激活打补丁、机械可解释性等方法分析模型内部行为,闭源API模型无法开展此类分析71% 相似待验证OpenAI于2018年提出'AI Safety via Debate'理论,核心假设是多个模型的对抗性讨论能逼近正确答案71% 相似待验证AI模型的过度拒绝(over-refusal)是安全对齐研究中的已知问题,RLHF和Constitutional AI训练会使模型将无害请求错误归类为需要拒绝68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/507379API
curl https://kongchang.com/api/v1/knowledge/claims/507379MCP
get_claim(id=507379)