[控场AI]
待验证75% 置信事实时间未知

2024年以来,研究者发现了对抗性后缀攻击(Adversarial Suffix),即在正常提示后附加一串看似无意义的token序列就能让模型忽略安全对齐

1
来源数
75%
置信度
长期有效
时效性
2026/6/1
首次发现

来源

涉及实体

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/27801
API
curl https://kongchang.com/api/v1/knowledge/claims/27801
MCP
get_claim(id=27801)