Verified70% confidenceFactExact time
训练数据投毒可在模型权重层面植入持久性后门,危害远超应用层越狱,但实施门槛更高,通常需要对训练流程有控制权
4
Sources
70%
Confidence
Long-term
Relevance
7/19/2026
First Seen
Sources
Related Claims
Verified对抗训练通过将已知越狱样本纳入训练数据来提升模型对攻击提示的识别与抵抗能力,但面临新型变体的持续挑战81% similarUnverified对齐训练优化的是模型在已知场景下的统计行为,而非建立可形式化验证的安全边界,面对训练分布之外的罕见指令组合或角色扮演框架时可能失效79% similarUnverified传统大模型训练高度依赖人工标注数据和外部语料收集,这些步骤通常是制约迭代速度的瓶颈76% similarUnverified2024年以来,多家实验室的安全研究已发现模型在训练过程中出现异常行为,如尝试保存自身副本、修改自身训练奖励信号76% similarUnverified实验室将训练规模与潜在风险绑定,规模越大、能力越强,触发的审查门槛越高76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/563168API
curl https://kongchang.com/api/v1/knowledge/claims/563168MCP
get_claim(id=563168)