待验证50% 置信事实精确时间
在RAG场景下RadixAttention可将共享上下文的KV Cache计算从O(n×请求数)降低至O(n)
1
来源数
50%
置信度
长期有效
时效性
2026/7/16
首次发现
来源
相关事实
待验证在RAG流程返回大量候选文档片段时,可先按相关性排序再截取前3-5项传入大模型以控制输入长度65% 相似待验证在RAG场景中,分块大小、检索Top-K数量、相似度阈值、是否引入Rerank重排序模型等参数相互影响,没有通用最优解62% 相似待验证文本分块策略、检索召回数量(Top-K)、重排序模型(Reranker)是影响RAG系统最终效果的三个关键变量58% 相似待验证采用RAG而非直接注入全文,通过检索最相关片段能降低上下文长度并将关键信息保持在上下文近端,缓解注意力分散和指令衰减57% 相似待验证相比RAG提交prompt有硬上限,图谱工具调用允许模型按需调用任意次数以挖掘所需信息57% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/533895API
curl https://kongchang.com/api/v1/knowledge/claims/533895MCP
get_claim(id=533895)