待验证50% 置信事实精确时间
研究表明攻击者只需修改训练数据中低至0.01%的比例,就可能在模型中植入标准评估中不可检测的后门行为
1
来源数
50%
置信度
长期有效
时效性
2026/9/10
首次发现
来源
涉及实体
相关事实
待验证2023年,研究人员证明只需污染不到1%的训练数据,就能在特定触发条件下改变模型行为74% 相似待验证成员推断攻击的核心假设是模型对训练集中的样本会产生更低的预测损失,通过设定损失阈值区分成员与非成员样本74% 相似待验证Anthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点70% 相似待验证在标准行人检测数据集(如MOTChallenge)上训练的模型,在俯视视角下的检测精度(mAP)通常下降40%-60%69% 相似待验证卡内基梅隆大学研究显示对抗性图案攻击成功率在受控环境为90%以上,但引入正常视角变化后降至实际部署场景的30%以下69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/887229API
curl https://kongchang.com/api/v1/knowledge/claims/887229MCP
get_claim(id=887229)