Unverified50% confidenceFactExact time
随着OpenAI、Anthropic等公司对模型对齐研究的深入,新一代模型开始被训练出'有益的抵抗'能力,在用户推理错误或提出有害请求时给予反驳
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/14/2026
First Seen
Valid until: 10/12/2026
Sources
Related Claims
UnverifiedAnthropic、OpenAI等机构已发表多篇论文研究AI谄媚性现象,发现即使最先进的模型也会在用户施加压力时改变正确答案以迎合用户73% similarUnverified主动要求AI引入可信瑕疵可以对抗模型的讨好性偏差,从而提升输出的真实度71% similarUnverified开源模型权重使研究者能利用探针、激活打补丁、机械可解释性等方法分析模型内部行为,闭源API模型无法开展此类分析71% similarUnverifiedOpenAI于2018年提出'AI Safety via Debate'理论,核心假设是多个模型的对抗性讨论能逼近正确答案71% similarUnverifiedAI模型的过度拒绝(over-refusal)是安全对齐研究中的已知问题,RLHF和Constitutional AI训练会使模型将无害请求错误归类为需要拒绝68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/507379API
curl https://kongchang.com/api/v1/knowledge/claims/507379MCP
get_claim(id=507379)