Unverified50% confidenceBenchmarkExact time
消融实验显示,若继续训练主干通用知识掉10%、数学掉17.8%;若两塔共享权重则通用任务掉26%,其余指标全线崩溃
1
Sources
50%
Confidence
Long-term
Relevance
7/20/2026
First Seen
Sources
Related Claims
UnverifiedAnthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点72% similarVerified在长链路任务中,若每一步约5%的错误率,经过20步后整体成功率可能跌至不足36%68% similarUnverified发布的checkpoint按块大小16训练,若将采样块大小改为64,HumanEval从76%跌至约20%,GSM8K从高位跌到2.2%67% similarUnverified实验数据显示,经过5-10轮迭代训练后,模型在低频词汇和长尾知识上的覆盖率下降超过40%,而输出文本在表面流畅性上几乎没有可察觉的退化67% similarUnverified测试损失与计算量之间的幂律指数约为0.05,意味着计算量每增加10倍,模型性能提升约12%67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/565267API
curl https://kongchang.com/api/v1/knowledge/claims/565267MCP
get_claim(id=565267)