Unverified50% confidenceFactExact time
DSpark 对 MLA 上投影计算路径进行了 CUDA 内核融合优化,将还原计算与注意力计算合并为单个 kernel 执行
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/16/2026
First Seen
Valid until: 10/14/2026
Sources
Related Claims
Unverified新内核通过将量化/反量化操作融合进注意力计算的 CUDA Kernel 中,使 KV 缓存量化不再造成推理减速,某些带宽受限场景下甚至能进一步提升吞吐71% similarUnverifiedOptimize Anything可应用于CUDA内核优化、云调度策略、智能体架构、SVG图像和系统提示等多种场景68% similarUnverifiedTensorRT能针对CUDA和GPU优化张量运算,进一步提升性能67% similarUnverifiedTensorRT深度绑定CUDA生态,提供最激进的自动图优化和kernel自动调优,是车载GPU平台的首选67% similarUnverifiedNVIDIA的CUDA框架允许开发者控制硬件如何分配和处理任务,将工作分布到不同节点和工作线程上实现并行计算66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/533863API
curl https://kongchang.com/api/v1/knowledge/claims/533863MCP
get_claim(id=533863)