待验证50% 置信事实精确时间
Anthropic和OpenAI都将模型规避关闭、欺骗性对齐等安全问题列为重点研究方向,OpenAI设有超级对齐项目
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/19
首次发现
有效期至:2026/12/18
来源
涉及实体
相关事实
待验证OpenAI将把其最先进的AI模型能力以更低成本甚至免费的方式提供给符合条件的关键服务机构,用于威胁检测、事件响应、漏洞分析等安全场景80% 相似待验证OpenAI的InstructGPT、Anthropic的Constitutional AI以及Meta的Llama系列都采用了类似的安全对齐流程79% 相似已验证OpenAI有Preparedness Framework,对模型在网络安全、CBRN威胁、说服力和自主行为四个维度进行分级评估79% 相似待验证OpenAI、Anthropic等主流大模型公司均将安全对齐作为产品发布前的核心环节79% 相似待验证OpenAI、Anthropic等公司正在研究的防注入技术方案包括将数据内容沙盒化、训练模型拒绝执行数据层指令、以及用监督模型检测执行模型输出77% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/935699API
curl https://kongchang.com/api/v1/knowledge/claims/935699MCP
get_claim(id=935699)