待验证50% 置信解决方案精确时间
算子融合将多个连续算子合并为一个复合算子,让中间结果在寄存器或缓存中完成计算,能减少内存带宽消耗60%-80%
1
来源数
50%
置信度
长期有效
时效性
2026/9/7
首次发现
来源
涉及实体
相关事实
待验证TensorRT的层融合优化中,以Conv-BN-ReLU组合为例,融合后内存访问量可减少60%以上74% 相似待验证提示词缓存通过在服务器端保存已计算的 KV 矩阵,将重复前缀的处理从 O(n²) 降低至 O(1) 的缓存读取,可实现高达90%的延迟和成本压缩72% 相似待验证通过Prompt压缩移除冗余描述、采用结构化格式可减少输入Token 20%-40%,综合运用Prompt工程技巧可将相同质量输出的Token消耗降低30%-60%68% 相似待验证FlashAttention 通过分块计算(tiling)和重计算(recomputation)策略,将中间激活值的存储需求从 O(N²) 压缩至 O(N)68% 相似待验证上下文压缩的常见方法包括基于摘要的压缩、选择性保留和分层记忆68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/869637API
curl https://kongchang.com/api/v1/knowledge/claims/869637MCP
get_claim(id=869637)