[控场AI]
概念负责任扩展政策 / RSP

Responsible Scaling Policy

责任规模化政策(Responsible Scaling Policy,RSP)是Anthropic制定的AI安全治理框架,旨在规范高能力AI模型的开发与部署流程。该框架将AI系统的潜在风险能力划分为从ASL-1到ASL-4+的多个安全级别,并针对不同级别规定相应的评估要求、安全标准与部署条件,以确保在AI能力提升的过程中,相关安全措施能够同步跟进,防止灾难性或不可逆风险的发生。

核心事实

时间轴 (近 90 天)

10月3日

RSP等政策的执行监督权仍在公司内部,外部核查机制尚不完善

待验证50%
9月30日

「负责任扩展政策」框架中,阈值的定义权、评估方法选择权及结果披露决策权均留在公司内部,批评者认为这等同于让运动员自己担任裁判

待验证50%
9月30日

「负责任扩展政策」(Responsible Scaling Policy)框架的核心逻辑是由开发者自行设定能力阈值,当模型达到特定风险等级时触发相应的安全评估义务

待验证50%
9月28日

OpenAI的负责任扩展政策(Responsible Scaling Policy)规定了一系列评估触发点,当模型达到特定能力阈值时必须完成安全评估才能继续训练或部署

待验证50%
9月27日

RSP的核心逻辑是:在模型能力达到某个预设危险阈值之前,必须先证明相应的安全措施已到位,否则暂停进一步扩展训练

待验证50%
9月27日

批评者指出RSP本质上是企业自我监管,缺乏外部约束力,Anthropic既是规则制定者也是被约束对象

待验证50%
9月27日

RSP将模型危险等级划分为AI Safety Level(ASL)1至4级,并为每个级别规定了具体的评估要求和部署限制

待验证50%
9月22日

Anthropic的负责任扩展政策(RSP)规定,模型达到特定危险能力阈值后必须满足对应安全标准才能继续训练或部署

已验证75%
9月19日

这些负责任扩展政策和安全框架均为企业自愿制定,标准不一,执行与验证依赖企业自身

待验证50%
9月19日

Anthropic、OpenAI等公司各自发布了负责任扩展政策或安全框架,设定能力阈值并规定达到阈值时应采取的缓解或披露措施

待验证50%

还有 12 条时间轴事件

全部知识事实 (20)

已验证

Anthropic的负责任扩展政策(RSP)规定,模型达到特定危险能力阈值后必须满足对应安全标准才能继续训练或部署

75%
已验证

Anthropic推行了负责任扩展政策(Responsible Scaling Policy, RSP),根据模型能力等级设定对应的安全防护要求

65%
已验证

责任扩展政策(Responsible Scaling Policy, RSP)最早由Anthropic公司于2023年正式提出,其设计灵感来源于生物安全等级(BSL-1到BSL-4)分级体系

65%
待验证

Anthropic在2023年发布了Responsible Scaling Policy(负责任扩展政策,RSP),其设计逻辑与OpenAI的Preparedness Framework高度相似

70%
待验证

多家头部实验室已发布各自的负责任扩展政策(Responsible Scaling Policy)或准备框架(Preparedness Framework),为模型能力设定风险等级阈值

70%
待验证

Anthropic采用'负责任扩展'(Responsible Scaling)作为核心理念

70%
待验证

RSP等政策的执行监督权仍在公司内部,外部核查机制尚不完善

50%
待验证

「负责任扩展政策」框架中,阈值的定义权、评估方法选择权及结果披露决策权均留在公司内部,批评者认为这等同于让运动员自己担任裁判

50%
待验证

「负责任扩展政策」(Responsible Scaling Policy)框架的核心逻辑是由开发者自行设定能力阈值,当模型达到特定风险等级时触发相应的安全评估义务

50%
待验证

OpenAI的负责任扩展政策(Responsible Scaling Policy)规定了一系列评估触发点,当模型达到特定能力阈值时必须完成安全评估才能继续训练或部署

50%
待验证

批评者指出RSP本质上是企业自我监管,缺乏外部约束力,Anthropic既是规则制定者也是被约束对象

50%
待验证

RSP的核心逻辑是:在模型能力达到某个预设危险阈值之前,必须先证明相应的安全措施已到位,否则暂停进一步扩展训练

50%
待验证

RSP将模型危险等级划分为AI Safety Level(ASL)1至4级,并为每个级别规定了具体的评估要求和部署限制

50%
待验证

Anthropic、OpenAI等公司各自发布了负责任扩展政策或安全框架,设定能力阈值并规定达到阈值时应采取的缓解或披露措施

50%
待验证

这些负责任扩展政策和安全框架均为企业自愿制定,标准不一,执行与验证依赖企业自身

50%
待验证

Anthropic在其「负责任的扩展政策」(Responsible Scaling Policy)中多次强调外部评估的重要性

50%
待验证

Anthropic、Google DeepMind 等机构已在内部实践类似的'负责任扩展政策'(Responsible Scaling Policy)

50%
待验证

负责任扩展政策依赖自愿遵守,其局限性在于竞争对手未必会跟进

50%
待验证

当模型能力达到可能协助生物、化学或核武器研发的阈值时,Anthropic会启用更严格的部署限制和监控措施

50%
待验证

Anthropic制定了负责任扩展政策(Responsible Scaling Policy)

50%

来源文章