Unverified50% confidenceFactExact time
研究表明攻击者只需修改训练数据中低至0.01%的比例,就可能在模型中植入标准评估中不可检测的后门行为
1
Sources
50%
Confidence
Long-term
Relevance
9/10/2026
First Seen
Sources
Related Entities
Related Claims
Unverified2023年,研究人员证明只需污染不到1%的训练数据,就能在特定触发条件下改变模型行为74% similarUnverified成员推断攻击的核心假设是模型对训练集中的样本会产生更低的预测损失,通过设定损失阈值区分成员与非成员样本74% similarUnverifiedAnthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点70% similarUnverified在标准行人检测数据集(如MOTChallenge)上训练的模型,在俯视视角下的检测精度(mAP)通常下降40%-60%69% similarUnverified卡内基梅隆大学研究显示对抗性图案攻击成功率在受控环境为90%以上,但引入正常视角变化后降至实际部署场景的30%以下69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/887229API
curl https://kongchang.com/api/v1/knowledge/claims/887229MCP
get_claim(id=887229)