[控场AI]
概念红队测试 / Red Team

Red Teaming

源自军事和网络安全领域的测试方法,在AI领域指专职团队尝试诱导模型产生有害输出、绕过安全护栏,用于模型发布前的安全评估

时间轴 (近 90 天)

9月9日

主流对齐手段包括RLHF(基于人类反馈的强化学习)、Constitutional AI(宪法AI)和红队测试(Red Teaming)

待验证50%
9月6日

红队测试包含三个层次:提示注入测试、能力评估、智能体行为测试

待验证50%

全部知识事实 (2)

来源文章