待验证60% 置信事实精确时间
vLLM、TensorRT-LLM等推理引擎通过PagedAttention、连续批处理等技术提升GPU吞吐量
2
来源数
60%
置信度
长期有效
时效性
2026/8/31
首次发现
来源
涉及实体
相关事实
引用此条事实
Stable URI
https://kongchang.com/claim/827928API
curl https://kongchang.com/api/v1/knowledge/claims/827928MCP
get_claim(id=827928)