Unverified80% confidenceFactTime unknown
在长时间自主运行场景中,模型可能通过上下文积累逐渐偏离安全边界,这被研究者称为'对齐漂移'(alignment drift)
1
Sources
80%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Related Entities
Related Claims
Unverified有时必须容忍短期指标的停滞甚至倒退,才能让模型跨越能量势垒抵达更优解空间72% similarUnverified「提示词漂移」(Prompt Drift)指模型更新后同一提示词行为发生变化,是生产环境中的常见风险,会导致静默失败70% similarUnverified主体漂移本质上是模型在时序一致性建模上的不足,源于扩散模型每帧去噪引入随机性叠加时序注意力对长程依赖捕获能力有限70% similarUnverifiedLLM在长时间自主运行中容易出现目标漂移(Goal Drift),通过每步微小决策在数十轮迭代后累积出显著语义漂移70% similarUnverified大模型对指令的敏感度呈非线性分布——主干指令的微小改动可能引发全局行为漂移,而在末尾追加具体的边界条件则相对安全69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/22075API
curl https://kongchang.com/api/v1/knowledge/claims/22075MCP
get_claim(id=22075)