概念红队测试 / Red Team
Red Teaming
源自军事和网络安全领域的测试方法,在AI领域指专职团队尝试诱导模型产生有害输出、绕过安全护栏,用于模型发布前的安全评估
时间轴 (近 90 天)
9月9日
主流对齐手段包括RLHF(基于人类反馈的强化学习)、Constitutional AI(宪法AI)和红队测试(Red Teaming)
待验证50%
9月6日
红队测试包含三个层次:提示注入测试、能力评估、智能体行为测试
待验证50%
7月2日
Red Teaming(红队测试)是大语言模型安全机制的核心技术之一,由专业安全团队在模型发布前模拟各种攻击场景进行压力测试
待验证50%