待验证50% 置信事实精确时间
传统LLM经过RLHF人类偏好对齐后倾向于给出措辞坚定的答案,会导致概率估计失真
1
来源数
50%
置信度
长期有效
时效性
2026/9/23
首次发现
来源
涉及实体
相关事实
待验证RLHF is intended to align the model with human preferences, but human preferences tend to reward 'confident and detailed' responses, creating a paradox that reinforces hallucination75% 相似已验证RLHF机制中人类标注者往往对超出预期、提供额外细节的回答给出更高评分,从而系统性地鼓励模型进行推断性补全75% 相似待验证RLHF评分者通常偏好措辞流畅、立场平和、不引发争议的回答,导致模型形成最大公约数式的表达风格74% 相似待验证在RLHF中,如果偏好数据质量低下或存在系统性偏差,奖励模型会学到错误信号,导致模型行为偏离预期74% 相似待验证主流LLM采用下一词预测目标,模型优化的是语言分布拟合度而非事实准确性,RLHF无法从根本上消除幻觉,完全消除幻觉在现有架构下被普遍认为不可能74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/943259API
curl https://kongchang.com/api/v1/knowledge/claims/943259MCP
get_claim(id=943259)