待验证50% 置信基准精确时间
发布的checkpoint按块大小16训练,若将采样块大小改为64,HumanEval从76%跌至约20%,GSM8K从高位跌到2.2%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/20
首次发现
有效期至:2026/10/18
来源
相关事实
待验证消融实验显示,若继续训练主干通用知识掉10%、数学掉17.8%;若两塔共享权重则通用任务掉26%,其余指标全线崩溃67% 相似待验证接受率随位置逐级衰减:GSM8K从位置0的0.92下滑至约0.53,MTBench从0.78急跌至0.13,因误差在连续猜测中累积66% 相似待验证对LLaMA-7B所有注意力层应用r=8的LoRA,可训练参数量从70亿降至约400万,压缩比超过1750倍64% 相似待验证在标准行人检测数据集(如MOTChallenge)上训练的模型,在俯视视角下的检测精度(mAP)通常下降40%-60%64% 相似待验证CodeGraph测试显示工具调用次数减少约58%63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/565268API
curl https://kongchang.com/api/v1/knowledge/claims/565268MCP
get_claim(id=565268)