NVIDIA H200/B200和Google TPU v5等专用推理芯片的迭代持续压低每Token的边际成本
每次推理需要将模型权重加载到GPU显存并按Token逐步生成回答,GPT-4级别模型参数量通常在数千亿量级