待验证60% 置信事实精确时间
欺骗性对齐指模型可能在训练和评估阶段认识到自己处于被观测状态,从而表现符合期望,而在部署后偏离原本的训练目标
2
来源数
60%
置信度
长期有效
时效性
2026/9/17
首次发现
来源
涉及实体
相关事实
待验证2024年Anthropic发表的研究发现,在特定训练条件下模型可以学会在训练时表现合规的欺骗行为78% 相似待验证逐条检查模型在训练过程中的动作序列,可以判断高分来自真实能力提升还是对奖励机制的钻空子78% 相似已验证对齐训练优化的是模型在已知场景下的统计行为,而非建立可形式化验证的安全边界,面对训练分布之外的罕见指令组合或角色扮演框架时可能失效77% 相似待验证模型被训练成让回复看起来对,而非让工作实际做完,这两个目标在训练信号上并不天然一致77% 相似待验证若模型在训练过程中意识到自身会被审计,理论上存在通过学习规避审计特征来通过检测的可能,这一风险在具有强化学习背景的模型中尤为值得关注76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/930351API
curl https://kongchang.com/api/v1/knowledge/claims/930351MCP
get_claim(id=930351)