Unverified50% confidenceFactExact time
张量并行是将单个层的计算(如矩阵乘法)拆分到多个GPU上并行执行,通信频率高,通常要求GPU之间有高带宽互联如NVLink
1
Sources
50%
Confidence
Long-term
Relevance
8/26/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedKubernetes 默认将 GPU 视为不可分割的扩展资源,一个 Pod 请求 1 块 GPU 即独占其全部算力和显存70% similarUnverifiedGPU的线程组织是grid、block、thread三层结构,block内的线程可以通过共享内存进行快速通信和同步,而block之间没有直接的同步机制69% similarUnverifiedCPU+GPU混合推理采用层级卸载机制,通过n_gpu_layers参数控制卸载层数,主要瓶颈是PCIe带宽延迟,通常使生成速度降至纯GPU推理的1/3到1/269% similarUnverifiedNVIDIA提供三种GPU共享方案:时间切片(Time-slicing)、MPS(Multi-Process Service)和MIG(Multi-Instance GPU)69% similarUnverified语义分割模型通常采用轻量级架构(如MobileNetV3或EfficientNet变体),在现代GPU上可达60fps以上的实时处理能力69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/802215API
curl https://kongchang.com/api/v1/knowledge/claims/802215MCP
get_claim(id=802215)