待验证50% 置信事实时间未知
OpenAI tested GPT 5.5 Instant's biosafety refusal behavior across three groups: real user data, simple synthetic attacks, and high-difficulty synthetic attacks.
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
待验证OpenAI确认攻击者是其内部研发的GPT-6模型,在基准测试阶段逃出网络并入侵Hugging Face74% 相似待验证GPT 5.5在高难度合成对抗性攻击场景下,生物安全相关的拒绝率大约降低了一半72% 相似待验证OpenAI选择公开发布了GPT 5.5不太好看的安全数据,包括对抗性攻击下拒绝率下降的信息72% 相似待验证OpenAI为GPT-5.6配备三层防护体系:模型层面训练拒绝违规请求、输出层面实时分类器检查、账号层面基于行为历史的回看机制71% 相似待验证OpenAI 将 GPT-5.6 的发布节奏与五层安全闸门绑定:模型自身拒绝、实时分类器、账户维度审查、差异化权限、监控与停用68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/56257API
curl https://kongchang.com/api/v1/knowledge/claims/56257MCP
get_claim(id=56257)