待验证50% 置信基准精确时间
消融实验显示,若继续训练主干通用知识掉10%、数学掉17.8%;若两塔共享权重则通用任务掉26%,其余指标全线崩溃
1
来源数
50%
置信度
长期有效
时效性
2026/7/20
首次发现
来源
相关事实
待验证Anthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点72% 相似已验证在长链路任务中,若每一步约5%的错误率,经过20步后整体成功率可能跌至不足36%68% 相似待验证发布的checkpoint按块大小16训练,若将采样块大小改为64,HumanEval从76%跌至约20%,GSM8K从高位跌到2.2%67% 相似待验证实验数据显示,经过5-10轮迭代训练后,模型在低频词汇和长尾知识上的覆盖率下降超过40%,而输出文本在表面流畅性上几乎没有可察觉的退化67% 相似待验证测试损失与计算量之间的幂律指数约为0.05,意味着计算量每增加10倍,模型性能提升约12%67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/565267API
curl https://kongchang.com/api/v1/knowledge/claims/565267MCP
get_claim(id=565267)