Concept红队测试 / Red Team
Red Teaming
源自军事和网络安全领域的测试方法,在AI领域指专职团队尝试诱导模型产生有害输出、绕过安全护栏,用于模型发布前的安全评估
Timeline (last 90 days)
Sep 9
主流对齐手段包括RLHF(基于人类反馈的强化学习)、Constitutional AI(宪法AI)和红队测试(Red Teaming)
Unverified50%
Sep 6
红队测试包含三个层次:提示注入测试、能力评估、智能体行为测试
Unverified50%
Jul 2
Red Teaming(红队测试)是大语言模型安全机制的核心技术之一,由专业安全团队在模型发布前模拟各种攻击场景进行压力测试
Unverified50%