待验证50% 置信事实精确时间
Anthropic、OpenAI等前沿实验室投入大量资源研究如何防止模型学会欺骗、操纵或规避监督
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/31
首次发现
有效期至:2026/11/29
来源
涉及实体
相关事实
待验证随着OpenAI、Anthropic等公司对模型对齐研究的深入,新一代模型开始被训练出'有益的抵抗'能力,在用户推理错误或提出有害请求时给予反驳75% 相似待验证OpenAI等机构在相关研究中强调,过度优化思维链可能导致模型学会表面上无害、实际上仍在欺骗的行为策略,即所谓的混淆的奖励黑客(Obfuscated Reward Hacking)72% 相似待验证Anthropic、OpenAI等机构已发表多篇论文研究AI谄媚性现象,发现即使最先进的模型也会在用户施加压力时改变正确答案以迎合用户69% 相似待验证Anthropic长期强调前沿模型可能带来的滥用风险,主张对模型权重的公开发布保持审慎甚至限制态度69% 相似待验证Anthropic官方将相关机制解释为防刷单、防偷学模型措施68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/829058API
curl https://kongchang.com/api/v1/knowledge/claims/829058MCP
get_claim(id=829058)