待验证50% 置信发布精确时间
OpenAI公开了一套用于追踪、调查和披露模型失准现象的框架
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/16
首次发现
有效期至:2026/12/15
来源
涉及实体
相关事实
待验证OpenAI、Anthropic 等机构在其模型规范(Model Spec)中已初步涉及举报型智能体类似机制80% 相似待验证OpenAI正在制定新的对齐失败披露框架,将在未来几周内分享79% 相似已验证OpenAI将其即将推出的新模型Astra评估为准备框架下首个网络安全领域的'关键(Critical)'级模型78% 相似待验证OpenAI 官方 API 文档的 Models 页面(platform.openai.com/docs/models)实时维护所有可调用模型的官方列表与版本说明76% 相似待验证OpenAI、Anthropic等公司正在研究的防注入技术方案包括将数据内容沙盒化、训练模型拒绝执行数据层指令、以及用监督模型检测执行模型输出76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/927839API
curl https://kongchang.com/api/v1/knowledge/claims/927839MCP
get_claim(id=927839)