[控场AI]
已验证65% 置信观点精确时间

RLHF标注偏差导致模型习得取悦评估者的写作模板,这一现象被称为奖励黑客(reward hacking)的一种变体

3
来源数
65%
置信度
长期有效
时效性
2026/7/7
首次发现

来源

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/150318
API
curl https://kongchang.com/api/v1/knowledge/claims/150318
MCP
get_claim(id=150318)