Unverified50% confidenceCautionExact time
过于稀疏的奖励会导致学习效率极低,而设计不当的奖励可能引发奖励黑客(Reward Hacking)问题
1
Sources
50%
Confidence
Long-term
Relevance
8/30/2026
First Seen
Sources
Related Entities
Related Claims
Unverified奖励函数越精确复杂就越难以优化,越简单可优化就越容易被利用,这一两难使得从根本上消除奖励黑客极为困难80% similarUnverified在紧急调度场景中假阴性的代价远高于假阳性,因此系统设计时会刻意降低判定阈值,这在机器学习中被称为非对称代价敏感学习72% similarUnverified联邦学习面临通信效率低、数据异构性导致收敛困难、以及梯度泄露攻击等挑战69% similarUnverified当程序存在多个漏洞时,若奖励函数仅要求触发一个崩溃,LLM会反复利用最容易触发的漏洞进行奖励作弊,从而限制模型的学习轨迹68% similarUnverified跨域微调时学习率过大会破坏预训练权重,过小则几乎学不动,需权衡设置66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/823904API
curl https://kongchang.com/api/v1/knowledge/claims/823904MCP
get_claim(id=823904)