待验证50% 置信注意事项精确时间
如果LoRA权重被逆向分析,攻击者可能从中推断出训练所用的私有数据内容,即记忆提取问题
1
来源数
50%
置信度
长期有效
时效性
2026/7/18
首次发现
来源
相关事实
待验证工具调用使攻击面从让模型说错话升级为让模型做错事,危害从信息误导上升为实质性的数据访问和系统篡改73% 相似待验证基准过拟合和数据污染会导致模型通过记忆而非真正理解获得高分,使公开基准分数可信度存疑72% 相似已验证数据投毒攻击是将恶意样本混入训练数据集,使模型在部署后对特定输入产生错误行为71% 相似待验证针对特定触发词的后门攻击可让模型在大多数情况下表现正常,仅在遇到特定输入时才输出预设错误信息,使常规评测基准难以捕捉69% 相似待验证《Stealing Reasoning Traces from Proprietary LLM APIs》研究指出,攻击者可通过API返回的间接信号重构甚至窃取模型的完整推理轨迹69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/556251API
curl https://kongchang.com/api/v1/knowledge/claims/556251MCP
get_claim(id=556251)