[KongchangAI]
Verified75% confidenceFactTime unknown

传统RLHF方法存在「奖励黑客」的根本性局限,模型可能学会在评估场景中表现良好却在分布外场景中失效

3
Sources
75%
Confidence
Long-term
Relevance
5/31/2026
First Seen

Sources

Related Entities

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/12262
API
curl https://kongchang.com/api/v1/knowledge/claims/12262
MCP
get_claim(id=12262)