待验证50% 置信事实精确时间
对抗训练由Goodfellow等人在对抗样本研究中系统化提出,通过在训练中引入对抗样本使模型学会识别和抵抗攻击
1
来源数
50%
置信度
长期有效
时效性
2026/7/17
首次发现
来源
相关事实
待验证对抗训练通过将已知越狱样本纳入训练数据来提升模型对攻击提示的识别与抵抗能力,但面临新型变体的持续挑战83% 相似已验证训练数据投毒可在模型权重层面植入持久性后门,危害远超应用层越狱,但实施门槛更高,通常需要对训练流程有控制权68% 相似待验证若模型在训练过程中意识到自身会被审计,理论上存在通过学习规避审计特征来通过检测的可能,这一风险在具有强化学习背景的模型中尤为值得关注66% 相似待验证应用层越狱防御必须同时依赖训练阶段的鲁棒性提升和推理阶段的动态监测,单一维度加固效果有限65% 相似待验证对齐训练优化的是模型在已知场景下的统计行为,而非建立可形式化验证的安全边界,面对训练分布之外的罕见指令组合或角色扮演框架时可能失效65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/544328API
curl https://kongchang.com/api/v1/knowledge/claims/544328MCP
get_claim(id=544328)