Unverified50% confidenceFactExact time
当成功率极低时几乎所有样本奖励相同,策略梯度方差极大而信噪比极低,导致模型无法获得有效更新方向
1
Sources
50%
Confidence
Long-term
Relevance
10/1/2026
First Seen
Sources
Related Entities
Related Claims
Unverified对于类别策略,随着输出分布变得越来越尖锐,其期望的 score-gradient 范数会趋近于零,使得自信但错误的 token 得到的更新最微弱77% similarUnverified输出质量的一致性在benchmark分数上往往难以体现,一个平均分高但偶发严重错误的模型在某些业务场景下的风险高于稳定但稍弱的模型77% similarUnverified记录'某个推荐方案不适用'的负样本与记录成功同样重要,否则模型会陷入统计偏差,把高频方案误当成高正确率方案76% similarUnverified模型在 Max 或 Ultra 等更高推理档位下未必产生更好或更高效的结果,有时反而因过度推理导致基准得分下降75% similarUnverified传统的成功率指标难以全面反映策略的鲁棒性,一个策略可能在90%的常规任务中表现出色却在剩余10%的关键场景中出现灾难性失败75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/965513API
curl https://kongchang.com/api/v1/knowledge/claims/965513MCP
get_claim(id=965513)