亚马逊AWS推出的自研AI推理芯片,针对云上推理工作负载定制设计,声称相比同类GPU实例可降低最高70%的推理成本
Inferentia是AWS于2019年推出的专用机器学习推理芯片,已迭代至第二代Inferentia2(inf2实例),单芯片可提供高达190 TOPS的INT8推理算力
推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降