[KongchangAI]
Unverified50% confidenceSolutionExact time

研究者提出长度归一化奖励方法,即在计算奖励分数时除以回答长度,使模型无法通过单纯增加长度获取更高奖励

1
Sources
50%
Confidence
Long-term
Relevance
8/22/2026
First Seen

Sources

Related Entities

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/786694
API
curl https://kongchang.com/api/v1/knowledge/claims/786694
MCP
get_claim(id=786694)