待验证70% 置信事实精确时间
传统推理将 Prefill 阶段和 Decode 阶段放在同一组 GPU 上串行执行,导致两类工作负载互相干扰,GPU 利用率难以最优化
2
来源数
70%
置信度
长期有效
时效性
2026/9/18
首次发现
来源
涉及实体
相关事实
待验证CPU+GPU混合推理采用层级卸载机制,通过n_gpu_layers参数控制卸载层数,主要瓶颈是PCIe带宽延迟,通常使生成速度降至纯GPU推理的1/3到1/277% 相似待验证GPU全栈范式将环境状态、动力学仿真、策略网络前向传播及梯度计算全部留在显存中完成,消除CPU与GPU的数据传输瓶颈77% 相似待验证GPU采用隐藏延迟的策略,通过同时调度成千上万个线程,在一批线程因等待内存阻塞时切换到就绪线程76% 相似待验证采用流水线架构使GPU对第N+1帧推理时CPU同时对第N帧后处理,可使理论吞吐量取决于最慢阶段而非所有阶段时间总和76% 相似待验证GPU利用率(DCGM_FI_DEV_GPU_UTIL)衡量的是采样周期内至少有一个kernel在GPU上运行的时间占比75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/933351API
curl https://kongchang.com/api/v1/knowledge/claims/933351MCP
get_claim(id=933351)