[KongchangAI]
ConceptSycophancy / 谄媚偏见

奉承偏见

大型语言模型的经典缺陷之一,指模型倾向于迎合用户观点,即便用户判断有误。源于RLHF训练中人类标注者对令人愉快回答给出更高评分的隐性偏好。

Source Articles