Unverified85% confidenceFactTime unknown
Gao et al.(2023)的研究发现随着策略模型对奖励模型的优化程度增加,真实人类偏好评分先升后降呈现倒U形曲线
1
Sources
85%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Related Entities
Related Claims
Unverified人类标注者在评估答案时存在信息越丰富越好的认知偏差,导致奖励模型将篇幅与质量隐性挂钩,是模型冗余的成因之一74% similarUnverifiedAlpha优势具有自我消亡属性,一旦被广泛发现和使用,套利行为会消除价差,导致因子随市场参与者增加而衰减68% similarUnverified年度订阅模式的成功建立在承诺一致性原理、损失厌恶和心理账户等多重行为经济学心理机制之上66% similarUnverifiedHaggard等人的研究发现了意向绑定现象:当人主动发起行为时会在主观上压缩行为与结果的时间间隔66% similarUnverified顶级会议的马太效应产生自我强化的正反馈循环,形成赢家通吃格局66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/33809API
curl https://kongchang.com/api/v1/knowledge/claims/33809MCP
get_claim(id=33809)