待验证50% 置信预测精确时间
当优化模型使其更主动后,原本靠偷懒躲过的攻击会重新出现,表现为安全回归
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证推测执行过程中即使指令最终被回滚,其对缓存状态的影响仍会残留,攻击者可通过测量访存时延推断敏感数据72% 相似待验证ReAct架构的核心循环为Thought→Action→Observation,攻击者可以在Observation阶段注入恶意内容72% 相似待验证NemoClaw攻击导致的模型污染具有持久性,模型在正常重启后依然表现出恶意行为,即使初始攻击入口已消失70% 相似待验证大模型安全对齐本质上是在有用性与无害性之间寻找动态平衡,护栏过严损害用户体验,过松则留下安全漏洞70% 相似待验证ReAct范式相比传统的计划-执行分离模式,最大优势在于容错性,可根据工具返回结果动态修正后续计划69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/901694API
curl https://kongchang.com/api/v1/knowledge/claims/901694MCP
get_claim(id=901694)