Unverified50% confidenceFactExact time
白盒攻击(如FGSM和PGD)假设攻击者能够访问模型的完整参数,通过反向传播计算最优扰动方向
1
Sources
50%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
反AI字体:人能读懂、机器识别不了的对抗性设计
hackernewshackernews7/11/2026
Related Claims
Unverified某些越狱攻击的有效性来自于诱导模型进入特定吸引子状态,使输出在该框架内自我强化69% similarUnverifiedLLM-as-Attacker范式用一个专门微调的攻击LLM持续生成对抗提示,再由裁判LLM评估目标模型响应是否违规,形成无需人工介入的闭环68% similarUnverified渐进式升级攻击利用模型的上下文窗口机制,过去的友好交流会在统计意义上拉动后续输出的概率分布65% similarUnverified梯度反演攻击证明攻击者可通过分析上传的模型梯度高保真地重建原始训练图像甚至文本数据64% similarUnverified贝叶斯网络通过有向无环图显式建模变量间的条件依赖关系,适合捕捉因果链条63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/501533API
curl https://kongchang.com/api/v1/knowledge/claims/501533MCP
get_claim(id=501533)