概念红队测试 / Red Team
Red Teaming
源自军事和网络安全领域的测试方法,在AI领域指专职团队尝试诱导模型产生有害输出、绕过安全护栏,用于模型发布前的安全评估
时间轴 (近 90 天)
9月9日
主流对齐手段包括RLHF(基于人类反馈的强化学习)、Constitutional AI(宪法AI)和红队测试(Red Teaming)
待验证50%
9月6日
红队测试包含三个层次:提示注入测试、能力评估、智能体行为测试
待验证50%
源自军事和网络安全领域的测试方法,在AI领域指专职团队尝试诱导模型产生有害输出、绕过安全护栏,用于模型发布前的安全评估
主流对齐手段包括RLHF(基于人类反馈的强化学习)、Constitutional AI(宪法AI)和红队测试(Red Teaming)
红队测试包含三个层次:提示注入测试、能力评估、智能体行为测试