Verified65% confidenceFactExact time
开源模型权重一旦公开,攻击者可以通过微调(fine-tuning)移除模型的安全限制
3
Sources
65%
Confidence
Long-term
Relevance
8/7/2026
First Seen
Sources
Related Claims
Unverified将敏感信息置于模型可访问范围之外是防御 prompt 注入类攻击的有效隔离措施75% similarUnverified一旦模型权重公开发布,任何人都可以下载、微调并移除安全对齐措施,传统的守门人模式失效74% similarUnverified过度封锁本身就是一种安全风险,因为它拦截防守方使人无法测试系统和发布补丁,而恶意行为者仍可使用其他模型包括开源模型73% similarUnverified对抗审查机制让另一个模型实例扮演攻击者专门寻找证明漏洞,只有能扛住攻击的证明才被保留73% similarPartially Verified间接提示注入攻击通过在正常业务数据中植入隐藏指令,诱导Agent执行未经授权的操作,属于语义层面而非代码层面的安全风险73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/702565API
curl https://kongchang.com/api/v1/knowledge/claims/702565MCP
get_claim(id=702565)