Unverified50% confidenceFactExact time
YaRN方法通过高频部分与低频部分的混合插值策略,在不进行大规模重新训练的情况下将上下文窗口扩展8-16倍
1
Sources
50%
Confidence
Long-term
Relevance
7/20/2026
First Seen
Sources
Related Claims
UnverifiedUltra-long context in LLMs relies on Sparse Attention, RoPE (Rotary Position Embedding) extrapolation, and KV Cache compression techniques57% similarUnverified梯度累积通过在多个小批次上累积梯度后再执行一次参数更新,效果等同于使用大批次训练56% similarUnverifiedEmbedding微调提升召回覆盖率,Rerank提升精排准确率,两者组合是生产级RAG系统的标配方案56% similarUnverifiedFP8动态范围较窄,在反向传播和梯度累积时容易出现数值溢出或下溢,因此训练侧actor保持BF16精度56% similarVerifiedHNSW通过构建多层图索引将搜索复杂度降至近似O(log n),IVF通过K-means聚类分割向量空间以牺牲约5-10%召回率换取数量级速度提升55% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/575505API
curl https://kongchang.com/api/v1/knowledge/claims/575505MCP
get_claim(id=575505)