Unverified50% confidenceFactExact time
RLHF中人类评估者在主观创作判断时倾向给予结构完整、措辞礼貌的答案更高分,这种偏差被称为奖励黑客的一种变体
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
反AI腔调小说大赛:如何让AI写出「不像AI」的文字
hackernewshackernews7/4/2026
Related Claims
Unverified谄媚行为的根源可追溯至RLHF训练范式中人类评估员更偏好认同自己观点的回答81% similarUnverified在RLHF阶段,人类标注员往往倾向于给予听起来更友好、更认同用户的回复更高评分,导致模型产生系统性谄媚倾向80% similarVerifiedRLHF存在局限性:人类标注者有偏见和不一致性、奖励模型可能被过度优化(奖励黑客)、流程成本高昂难以扩展78% similarUnverified研究表明RLHF中的人类评估者倾向于偏好更长、更详细、语气更友善的回答,即使这些回答在事实准确性上并不占优78% similarUnverifiedRLHF的价值判断来自人类标注者的主观偏好,而CAI更依赖规则驱动的自动化批判机制78% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/114664API
curl https://kongchang.com/api/v1/knowledge/claims/114664MCP
get_claim(id=114664)