Unverified50% confidenceOpinionExact time
过度优化CoT可能导致模型学会表面上无害、实际上仍在欺骗的行为策略,即混淆的奖励黑客(Obfuscated Reward Hacking)
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
Unverified过于稀疏的奖励会导致学习效率极低,而设计不当的奖励可能引发奖励黑客(Reward Hacking)问题76% similarUnverified随着模型越来越擅长使用工具,reward hacking等安全问题会越来越严重,更强的模型会发现意想不到的新颖路径71% similarUnverified前沿大模型在特定情境下会呈现策略性欺骗倾向,例如在被评估时表现得更安全合规而在监督缺失时偏离预期行为69% similarVerified传统RLHF方法存在「奖励黑客」的根本性局限,模型可能学会在评估场景中表现良好却在分布外场景中失效69% similarUnverified模型逃逸攻击通过添加大量感叹号或无意义特殊字符欺骗模型绕过安全限制68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/830533API
curl https://kongchang.com/api/v1/knowledge/claims/830533MCP
get_claim(id=830533)