Unverified50% confidenceCautionExact time
如果LoRA权重被逆向分析,攻击者可能从中推断出训练所用的私有数据内容,即记忆提取问题
1
Sources
50%
Confidence
Long-term
Relevance
7/18/2026
First Seen
Sources
Related Claims
Unverified工具调用使攻击面从让模型说错话升级为让模型做错事,危害从信息误导上升为实质性的数据访问和系统篡改73% similarUnverified基准过拟合和数据污染会导致模型通过记忆而非真正理解获得高分,使公开基准分数可信度存疑72% similarVerified数据投毒攻击是将恶意样本混入训练数据集,使模型在部署后对特定输入产生错误行为71% similarUnverified针对特定触发词的后门攻击可让模型在大多数情况下表现正常,仅在遇到特定输入时才输出预设错误信息,使常规评测基准难以捕捉69% similarUnverified《Stealing Reasoning Traces from Proprietary LLM APIs》研究指出,攻击者可通过API返回的间接信号重构甚至窃取模型的完整推理轨迹69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/556251API
curl https://kongchang.com/api/v1/knowledge/claims/556251MCP
get_claim(id=556251)