Unverified50% confidenceOpinionExact time
稀疏注意力/KV压缩论文中存在对基线和自己方法进行不对等超参数调优的美化手法
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
Unverified在单跳大海捞针任务中,关键的KV对在注意力分数上天然突出,压缩方法几乎不可能丢掉它,使其对压缩方法过于'友好'74% similarUnverified文章作者认为大多数人使用prompt模板时只是'填空',而非提供增量信息,导致输出质量不佳72% similarVerified分块策略中块太大导致语义焦点模糊,块太小导致上下文割裂,固定窗口、句子级、语义边界递归分块在不同场景各有权衡,没有普适最优解71% similarUnverifiedMulti-head Latent Attention通过将KV缓存压缩到低维潜在空间中,大幅降低推理时的显存占用和计算开销71% similarUnverified注意力稀释的根本原因在于Softmax归一化:序列中token越多,每个位置分配到的有效注意力权重随序列长度近似成反比例缩小69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/829705API
curl https://kongchang.com/api/v1/knowledge/claims/829705MCP
get_claim(id=829705)