共 2 篇相关文章
CogniCore 团队在为 AI Agent 记忆层编写安全测试时,被三位审查者从三个不同类别打破。本文剖析故障注入测试的盲区:测试必须击败保证本身而非实现它的代码行,并给出可泛化的工程原则。
一次针对AI客服代理的红队测试发现:即使没有任何单条恶意消息,通过长达数十轮的缓慢对话,模型也会逐步偏离安全策略,而护栏从未触发。本文解析多轮对话越狱的机制与防御思路。