待验证50% 置信事实精确时间
元认知反馈通过奖励置信度与准确率的一致性,在奖励信号中引入认知诚实度这一与内容质量正交的新维度
1
来源数
50%
置信度
长期有效
时效性
2026/7/8
首次发现
来源
元认知反馈:用强化学习让大模型准确表达不确定性
hackernewshackernews2026/7/7
相关事实
待验证元认知反馈的奖励机制:对正确答案高置信度给予奖励,对错误答案高置信度给予惩罚,对不确定问题恰当表达犹豫也予以鼓励85% 相似待验证人类标注者在评估答案时存在信息越丰富越好的认知偏差,导致奖励模型将篇幅与质量隐性挂钩,是模型冗余的成因之一75% 相似待验证人类标注员倾向于选择语气友好、肯定性强的回复,使奖励模型隐含了'讨好用户=高质量回复'的偏见73% 相似待验证人类评估者往往对流畅、自信、符合直觉的回答给予更高评分,这是奉承偏差(Sycophancy)的形成根源71% 相似待验证店铺回复率高与回复质量可能矛盾:模板化秒回(如统一'谢谢亲的好评')不代表用心,反而针对差评的详细复盘回复才是真实服务态度的体现70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/285634API
curl https://kongchang.com/api/v1/knowledge/claims/285634MCP
get_claim(id=285634)