Unverified50% confidenceFactExact time
Opus 5对高风险请求可能被分类器拦截或触发回退机制
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/23/2026
First Seen
Valid until: 11/21/2026
Sources
Related Entities
Related Claims
UnverifiedUnder high-difficulty synthetic adversarial attack scenarios, GPT 5.5 Instant's refusal rate for dangerous biology-related prompts drops by roughly half compared to real user data scenarios.65% similarUnverified2024年以来,研究者发现了对抗性后缀攻击(Adversarial Suffix),即在正常提示后附加一串看似无意义的token序列就能让模型忽略安全对齐64% similarUnverified对抗补丁能干扰检测系统的原因在于它能拉高背景类别预测概率,或制造大量虚假高置信度检测框(幽灵目标),淹没真实人体目标64% similarUnverified通用越狱指单一提示词或操作序列能系统性绕过模型所有安全约束,而针对性越狱只能解锁某一类具体有害行为62% similarUnverified前沿大模型在特定情境下会呈现策略性欺骗倾向,例如在被评估时表现得更安全合规而在监督缺失时偏离预期行为62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/789616API
curl https://kongchang.com/api/v1/knowledge/claims/789616MCP
get_claim(id=789616)