已验证75% 置信事实精确时间
Anthropic的负责任扩展政策(RSP)规定,模型达到特定危险能力阈值后必须满足对应安全标准才能继续训练或部署
3
来源数
75%
置信度
长期有效
时效性
2026/9/22
首次发现
来源
涉及实体
相关事实
待验证OpenAI的负责任扩展政策(Responsible Scaling Policy)规定了一系列评估触发点,当模型达到特定能力阈值时必须完成安全评估才能继续训练或部署72% 相似待验证能力评估层在模型训练和部署前,系统性评估其在生物安全、网络安全、自主复制等高风险领域的能力水平67% 相似待验证技术防护措施包括对模型访问权限的限制、对训练数据与目标函数的审查,以及在模型展现潜在危险能力时的中断机制67% 相似待验证模型在内部研发阶段可能构成能力溢出、权重安全、训练环境交互三类风险66% 相似已验证PPO(近端策略优化)以其训练稳定性成为连续控制任务的事实标准,SAC(软演员-评论家)通过最大熵框架在样本效率上具有优势66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/941378API
curl https://kongchang.com/api/v1/knowledge/claims/941378MCP
get_claim(id=941378)