Unverified50% confidenceBenchmarkExact time
纯语义搜索(dense RAG)在400K token时对埋藏在中间的事实召回率跌至0%,而BM25始终保持100%
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
VerifiedRAG实践中chunk_size通常设置在256至1024 token之间,并保留约10%至20%的重叠(Overlap)62% similarUnverified传统LLM推理中KV Cache的内存管理导致60%-80%的显存被浪费62% similarVerified以LLaMA-2 70B为例,处理4096 token上下文、批量大小32时,KV Cache可消耗超过80GB显存59% similarUnverified一个原始需要80GB显存的700亿参数模型经4-bit量化(Q4_K_M档)后仅需约40GB内存,推理质量在多数基准测试中损失通常在3%-8%以内58% similarUnverified该配置实现了262K超长上下文、KV Cache Q4量化和MTP投机采样三项优化,将24GB显存利用率压榨到99%58% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/901140API
curl https://kongchang.com/api/v1/knowledge/claims/901140MCP
get_claim(id=901140)