待验证50% 置信事实精确时间
Opus 5对高风险请求可能被分类器拦截或触发回退机制
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/23
首次发现
有效期至:2026/11/21
来源
涉及实体
相关事实
待验证Under high-difficulty synthetic adversarial attack scenarios, GPT 5.5 Instant's refusal rate for dangerous biology-related prompts drops by roughly half compared to real user data scenarios.65% 相似待验证2024年以来,研究者发现了对抗性后缀攻击(Adversarial Suffix),即在正常提示后附加一串看似无意义的token序列就能让模型忽略安全对齐64% 相似待验证对抗补丁能干扰检测系统的原因在于它能拉高背景类别预测概率,或制造大量虚假高置信度检测框(幽灵目标),淹没真实人体目标64% 相似待验证通用越狱指单一提示词或操作序列能系统性绕过模型所有安全约束,而针对性越狱只能解锁某一类具体有害行为62% 相似待验证前沿大模型在特定情境下会呈现策略性欺骗倾向,例如在被评估时表现得更安全合规而在监督缺失时偏离预期行为62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/789616API
curl https://kongchang.com/api/v1/knowledge/claims/789616MCP
get_claim(id=789616)