Unverified50% confidenceOpinionExact time
人类标注员倾向于奖励结构工整、语气平衡、显得博学的回答,从而系统性强化某些特定句式
1
Sources
50%
Confidence
Long-term
Relevance
7/14/2026
First Seen
Sources
Related Claims
Unverified人类标注员倾向于选择语气友好、肯定性强的回复,使奖励模型隐含了'讨好用户=高质量回复'的偏见77% similarUnverified协作式、角色明确、目标具体的提示词往往比模糊、对抗或测试性的提示词能获得质量更高的输出74% similarUnverified人类标注者在评估答案时存在信息越丰富越好的认知偏差,导致奖励模型将篇幅与质量隐性挂钩,是模型冗余的成因之一72% similarUnverified元认知反馈的奖励机制:对正确答案高置信度给予奖励,对错误答案高置信度给予惩罚,对不确定问题恰当表达犹豫也予以鼓励69% similarUnverifiedRLHF中人类评估者在主观创作判断时倾向给予结构完整、措辞礼貌的答案更高分,这种偏差被称为奖励黑客的一种变体68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/504385API
curl https://kongchang.com/api/v1/knowledge/claims/504385MCP
get_claim(id=504385)