待验证50% 置信基准精确时间
稀疏奖励与密集奖励在域内成功率上统计意义无法区分,但在留出的校准探针测试中差距高达 33 个百分点
1
来源数
50%
置信度
长期有效
时效性
2026/10/5
首次发现
来源
涉及实体
相关事实
待验证当成功率极低时几乎所有样本奖励相同,策略梯度方差极大而信噪比极低,导致模型无法获得有效更新方向71% 相似待验证对小样本切片设置绝对失败数上限比设置百分比门槛更稳健,且对样本量不敏感71% 相似待验证校准奖励存在一个未验证的风险:可能只是把所有输出的置信度压平到中间值,在 ECE 指标上表现好却丧失判别信息71% 相似待验证达特茅斯实验的1.30标准差效应量尚未完全达到布鲁姆的两西格玛门槛,但已远超绝大多数教育干预措施70% 相似待验证检测项越多单项成本越低,但假阳性率随项目数上升——40+项的大panel常出现多项弱阳性(0.35–0.7 kU/L),临床意义模糊,反而增加不必要的忌口焦虑;无明确症状时选10–20项精准panel优于盲测大panel70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/975475API
curl https://kongchang.com/api/v1/knowledge/claims/975475MCP
get_claim(id=975475)