待验证50% 置信基准精确时间
纯语义搜索(dense RAG)在400K token时对埋藏在中间的事实召回率跌至0%,而BM25始终保持100%
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
已验证RAG实践中chunk_size通常设置在256至1024 token之间,并保留约10%至20%的重叠(Overlap)62% 相似待验证传统LLM推理中KV Cache的内存管理导致60%-80%的显存被浪费62% 相似已验证以LLaMA-2 70B为例,处理4096 token上下文、批量大小32时,KV Cache可消耗超过80GB显存59% 相似待验证一个原始需要80GB显存的700亿参数模型经4-bit量化(Q4_K_M档)后仅需约40GB内存,推理质量在多数基准测试中损失通常在3%-8%以内58% 相似待验证该配置实现了262K超长上下文、KV Cache Q4量化和MTP投机采样三项优化,将24GB显存利用率压榨到99%58% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/901140API
curl https://kongchang.com/api/v1/knowledge/claims/901140MCP
get_claim(id=901140)