Unverified50% confidenceFactExact time
张量并行将单层计算拆分到多张GPU以降低单次推理延迟
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
Unverified批处理推理(Batching)将短时间内多个请求合并为一个批次可显著提升GPU吞吐量,但会引入额外排队延迟,需根据延迟容忍度权衡78% similarUnverified连续批处理(Continuous Batching)解决GPU利用率问题,防止序列长度不齐导致的算力浪费76% similarUnverifiedGPTQ通过对每一层权重进行二阶近似优化(基于OBS/OBQ框架)来最小化量化误差,通常需要如C4数据集的128条样本校准,单GPU上仅需数小时完成74% similarUnverifiedASIC通过在硅片层面硬编码特定计算图,可将推理延迟降低30-50%,并将每次推理能耗压缩至GPU的数分之一74% similarUnverified当模型参数量超出GPU显存容量时需要offload到系统内存,推理速度会从数十Token/秒骤降至个位数73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/906889API
curl https://kongchang.com/api/v1/knowledge/claims/906889MCP
get_claim(id=906889)