一种用AI生成的偏好标签替代部分人工标注来训练奖励模型的技术方法,是宪法AI的核心组成部分,将AI行为约束从隐性人类偏好转化为可审计的显性原则
缓解长度偏差的学术方案包括长度归一化奖励、DPO中的长度正则化、相同长度区间偏好比较、Constitutional AI和RLAIF
Anthropic主打宪法AI安全框架,训练分为SLAIF自我评估修改和RLAIF强化学习两阶段