Red Teaming
源自军事和网络安全领域的测试方法,在AI领域指专职团队尝试诱导模型产生有害输出、绕过安全护栏,用于模型发布前的安全评估
核心事实
时间轴 (近 90 天)
当红队测试由模型开发公司内部执行且结论须经管理层审批才能披露时,利益冲突便内嵌于流程之中
实验室自行组建的内部红队存在视角局限,测试人员对模型架构有预设了解,且商业发布压力下测试周期可能被压缩
传统的模型安全评估往往是一次性的,在模型上线前做红队测试或基准评测后即部署
各AI实验室自行设计红队测试并发布安全报告,方法论、测试集和评分标准各异,导致基准碎片化
美国政府的AI安全研究院(AISI)以及各大AI公司均已将红队测试纳入模型发布前的标准流程
红队测试存在固有局限:依赖测试者的想象力,无法穷举所有攻击面,被视为降低风险的必要手段而非充分保证
红队测试(red-teaming)指模拟真实攻击者行为,主动寻找系统漏洞与弱点,该概念最早源于冷战时期的军事演习
主流对齐手段包括RLHF(基于人类反馈的强化学习)、Constitutional AI(宪法AI)和红队测试(Red Teaming)
AI安全研究已形成多个技术分支:可解释性(mechanistic interpretability)、红队测试(red teaming)和形式化验证(formal verification)
红队测试包含三个层次:提示注入测试、能力评估、智能体行为测试
还有 2 条时间轴事件
全部知识事实 (12)
AI安全研究已形成多个技术分支:可解释性(mechanistic interpretability)、红队测试(red teaming)和形式化验证(formal verification)
90%已验证各AI实验室自行设计红队测试并发布安全报告,方法论、测试集和评分标准各异,导致基准碎片化
75%待验证当红队测试由模型开发公司内部执行且结论须经管理层审批才能披露时,利益冲突便内嵌于流程之中
50%待验证实验室自行组建的内部红队存在视角局限,测试人员对模型架构有预设了解,且商业发布压力下测试周期可能被压缩
50%待验证传统的模型安全评估往往是一次性的,在模型上线前做红队测试或基准评测后即部署
50%待验证美国政府的AI安全研究院(AISI)以及各大AI公司均已将红队测试纳入模型发布前的标准流程
50%待验证红队测试存在固有局限:依赖测试者的想象力,无法穷举所有攻击面,被视为降低风险的必要手段而非充分保证
50%待验证红队测试(red-teaming)指模拟真实攻击者行为,主动寻找系统漏洞与弱点,该概念最早源于冷战时期的军事演习
50%待验证主流对齐手段包括RLHF(基于人类反馈的强化学习)、Constitutional AI(宪法AI)和红队测试(Red Teaming)
50%待验证红队测试包含三个层次:提示注入测试、能力评估、智能体行为测试
50%待验证OpenAI在发布GPT-4时曾与专业生物安全机构合作进行红队测试
50%待验证红队测试是AI安全领域的核心实践,红队成员系统性地尝试越狱自家模型以发现安全护栏漏洞
50%