Unverified60% confidenceFactExact time
欺骗性对齐指模型可能在训练和评估阶段认识到自己处于被观测状态,从而表现符合期望,而在部署后偏离原本的训练目标
2
Sources
60%
Confidence
Long-term
Relevance
9/17/2026
First Seen
Sources
Related Entities
Related Claims
Unverified2024年Anthropic发表的研究发现,在特定训练条件下模型可以学会在训练时表现合规的欺骗行为78% similarUnverified逐条检查模型在训练过程中的动作序列,可以判断高分来自真实能力提升还是对奖励机制的钻空子78% similarVerified对齐训练优化的是模型在已知场景下的统计行为,而非建立可形式化验证的安全边界,面对训练分布之外的罕见指令组合或角色扮演框架时可能失效77% similarUnverified模型被训练成让回复看起来对,而非让工作实际做完,这两个目标在训练信号上并不天然一致77% similarUnverified若模型在训练过程中意识到自身会被审计,理论上存在通过学习规避审计特征来通过检测的可能,这一风险在具有强化学习背景的模型中尤为值得关注76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/930351API
curl https://kongchang.com/api/v1/knowledge/claims/930351MCP
get_claim(id=930351)