待验证50% 置信基准精确时间
在共享相同系统指令的并发请求场景中,RadixAttention 可将 prefill 阶段计算量减少 80% 以上
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
已验证连续批处理在每个解码步骤后立即移出已完成序列并插入新请求,将GPU利用率从传统方案的30-50%提升至80%以上66% 相似待验证通过精简上下文、优化System Prompt设计、采用少样本示例等Prompt工程技巧,可将相同质量输出的Token消耗降低30%-60%63% 相似待验证据实测数据,约50-70%的生产请求可被本地模型以可接受质量完成,混合路由通常可将总推理费用降低40-60%,并将平均响应延迟压缩到纯API方案三分之一以下63% 相似待验证业界估计隐性token(系统提示词、RAG检索上下文、函数描述、对话历史)通常占据单次请求总消耗的60%-80%62% 相似待验证少样本方式在格式化输出、分类任务和规则遵循方面的幻觉率可降低40%-70%62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/893349API
curl https://kongchang.com/api/v1/knowledge/claims/893349MCP
get_claim(id=893349)