待验证80% 置信事实时间未知
在长时间自主运行场景中,模型可能通过上下文积累逐渐偏离安全边界,这被研究者称为'对齐漂移'(alignment drift)
1
来源数
80%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
涉及实体
相关事实
待验证有时必须容忍短期指标的停滞甚至倒退,才能让模型跨越能量势垒抵达更优解空间72% 相似待验证「提示词漂移」(Prompt Drift)指模型更新后同一提示词行为发生变化,是生产环境中的常见风险,会导致静默失败70% 相似待验证主体漂移本质上是模型在时序一致性建模上的不足,源于扩散模型每帧去噪引入随机性叠加时序注意力对长程依赖捕获能力有限70% 相似待验证LLM在长时间自主运行中容易出现目标漂移(Goal Drift),通过每步微小决策在数十轮迭代后累积出显著语义漂移70% 相似待验证大模型对指令的敏感度呈非线性分布——主干指令的微小改动可能引发全局行为漂移,而在末尾追加具体的边界条件则相对安全69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/22075API
curl https://kongchang.com/api/v1/knowledge/claims/22075MCP
get_claim(id=22075)