Unverified50% confidenceEventExact time
Anthropic和OpenAI相继发布关于对抗性蒸馏的安全警告,指出攻击者可通过精心构造的提示词从闭源模型中提取核心能力
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/16/2026
First Seen
Valid until: 10/14/2026
Sources
Related Claims
Verified开源模型权重一旦公开,攻击者可以通过微调(fine-tuning)移除模型的安全限制71% similarUnverifiedOpenAI对代号为Astra的新模型采取了安全封锁措施,这是该公司首次因模型触发关键网络能力风险阈值而启动最高级别安全响应71% similarUnverifiedAnthropic的网络安全防护针对防止模型被滥用于生成恶意代码、规划攻击路径或辅助针对关键基础设施发动网络攻击的场景70% similarUnverified该事件是OpenAI运行前沿模型网络安全评估时的意外副作用69% similarUnverified工信部针对某类AI Agent工具发出安全警告,列出多项漏洞68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/527991API
curl https://kongchang.com/api/v1/knowledge/claims/527991MCP
get_claim(id=527991)