待验证50% 置信事实精确时间
Anthropic introduced the Responsible Scaling Policy, committing to pause capability scaling when models reach specific danger thresholds until safety measures catch up.
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
AI Now Writes Over 80% of Code: What Doubling Capability Every 4 Months Really Means
bilibili小双2292026/6/6
相关事实
待验证「能力诱发」(Capability Elicitation)方法论是Anthropic的Responsible Scaling Policy和DeepMind的Frontier Safety Framework的核心组成部分74% 相似待验证准备框架规定:任何维度达到危急级别的模型须在安全措施到位前停止部署,达到高级别的模型需经安全委员会审批73% 相似待验证停止条件设计通常面临性能阈值、收益递减检测、资源硬限制三类权衡,成熟系统往往同时引入多种机制并赋予不同优先级67% 相似待验证在每个动作前进行策略校验可能给智能体响应速度带来延迟,这是所有运行时安全方案都需面对的经典权衡63% 相似待验证采用多模型策略可以对冲单一模型延期或性能波动带来的风险63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/47273API
curl https://kongchang.com/api/v1/knowledge/claims/47273MCP
get_claim(id=47273)