待验证50% 置信事实精确时间
当成功率极低时几乎所有样本奖励相同,策略梯度方差极大而信噪比极低,导致模型无法获得有效更新方向
1
来源数
50%
置信度
长期有效
时效性
2026/10/1
首次发现
来源
涉及实体
相关事实
待验证对于类别策略,随着输出分布变得越来越尖锐,其期望的 score-gradient 范数会趋近于零,使得自信但错误的 token 得到的更新最微弱77% 相似待验证输出质量的一致性在benchmark分数上往往难以体现,一个平均分高但偶发严重错误的模型在某些业务场景下的风险高于稳定但稍弱的模型77% 相似待验证记录'某个推荐方案不适用'的负样本与记录成功同样重要,否则模型会陷入统计偏差,把高频方案误当成高正确率方案76% 相似待验证模型在 Max 或 Ultra 等更高推理档位下未必产生更好或更高效的结果,有时反而因过度推理导致基准得分下降75% 相似待验证传统的成功率指标难以全面反映策略的鲁棒性,一个策略可能在90%的常规任务中表现出色却在剩余10%的关键场景中出现灾难性失败75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/965513API
curl https://kongchang.com/api/v1/knowledge/claims/965513MCP
get_claim(id=965513)