Unverified50% confidenceBenchmarkExact time
发布的checkpoint按块大小16训练,若将采样块大小改为64,HumanEval从76%跌至约20%,GSM8K从高位跌到2.2%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/20/2026
First Seen
Valid until: 10/18/2026
Sources
Related Claims
Unverified消融实验显示,若继续训练主干通用知识掉10%、数学掉17.8%;若两塔共享权重则通用任务掉26%,其余指标全线崩溃67% similarUnverified接受率随位置逐级衰减:GSM8K从位置0的0.92下滑至约0.53,MTBench从0.78急跌至0.13,因误差在连续猜测中累积66% similarUnverified对LLaMA-7B所有注意力层应用r=8的LoRA,可训练参数量从70亿降至约400万,压缩比超过1750倍64% similarUnverified在标准行人检测数据集(如MOTChallenge)上训练的模型,在俯视视角下的检测精度(mAP)通常下降40%-60%64% similarUnverifiedCodeGraph测试显示工具调用次数减少约58%63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/565268API
curl https://kongchang.com/api/v1/knowledge/claims/565268MCP
get_claim(id=565268)