[控场AI]
· 5 分钟阅读· 2,550 字

Nori LLM 突破每秒百万Token:推理引擎的性能极限

Nori LLM 突破每秒百万Token:推理引擎的性能极限

Nori LLM声称每秒处理百万token,文章从技术角度审视这一数字的含义与评估方法。

Nori LLM在Hacker News上宣称实现每秒超100万token的推理吞吐,引发技术社区关注。文章指出,这类高吞吐数字并非单一请求的生成速度,而是连续批处理、PagedAttention、量化等多项优化技术叠加下的聚合表现。高聚合吞吐与低请求延迟之间存在根本性权衡——更大的批次意味着更高的首token延迟,使其更适合离线批处理而非实时交互场景。此外,脱离模型参数量、硬件配置和序列长度谈吞吐毫无意义。文章最终建议以测试透明度、可复现性和端到端延迟指标为维度,对此类性能声明保持审慎态度。

Nori LLM 的百万级吞吐意味着什么

近期在 Hacker News 上出现的一则技术分享引发关注:一个名为 Nori 的 LLM 推理项目宣称实现了每秒超过 100 万 token 的处理吞吐(1M tok/s)。虽然该讨论目前热度尚不算高(8 分、1 条评论),但这一数字本身值得从技术角度加以审视——因为它触及了大语言模型部署中最核心的成本与效率问题。

对于任何运行 LLM 服务的团队来说,token 吞吐量直接决定了单位硬件能服务多少并发请求,也直接映射到推理成本。达到百万级 tok/s 的量级,通常并非单一模型单次生成的速度,而是在批处理(batching)、多请求并发、以及底层内核优化共同作用下的聚合吞吐表现。

hackernews source: Nori LLM: Achieving Over 1M tok / s

高吞吐背后的关键技术路径

要理解这类性能数字,需要拆解现代推理引擎常见的优化手段。业界主流的高吞吐方案通常依赖几个支柱:连续批处理(continuous batching)让 GPU 不必等待整批请求完成即可动态填充新请求;PagedAttention 类技术通过分页管理 KV 缓存,大幅减少显存碎片;此外还有算子融合、量化(如 INT8/FP8)、以及针对特定硬件的定制内核。

吞吐与延迟的权衡

需要强调的是,高聚合吞吐往往以更大的批次为代价,而大批次会推高单请求的首 token 延迟(TTFT)。因此,「百万 tok/s」这样的峰值指标在实际生产环境中要结合服务级别目标(SLO)来解读。一个能跑出极高吞吐的系统,未必能同时满足低延迟的交互式场景需求。这也是评估任何推理引擎时应当追问的关键:这个数字是在什么模型规模、什么硬件、什么批次配置下测得的?

在 LLM 服务中,延迟通常拆分为两个关键指标:TTFT(Time To First Token,首 token 延迟) 衡量用户发出请求到收到第一个输出 token 的等待时间,直接影响交互体验;TPOT(Time Per Output Token,每 token 生成时间) 则衡量后续 token 的生成速率,决定流式输出的流畅程度。批次越大,每个请求在队列中等待的时间越长,TTFT 随之上升。因此,追求极致吞吐的引擎往往会牺牲 TTFT,更适合离线批量处理场景(如数据标注、文档摘要),而非对响应速度敏感的实时对话场景。生产环境中通常需要在 SLO 约束下寻找吞吐与延迟的最优平衡点,而非单纯最大化吞吐。

硬件与规模的隐含前提

百万级吞吐通常意味着较小的模型参数量、较短的序列长度,或是在多卡/多节点集群上聚合而来。同样的引擎跑一个 7B 模型和跑一个 70B 模型,吞吐会有数量级的差异。因此,脱离模型规模谈吞吐数字,参考价值有限。这也是社区在面对此类声明时应保持审慎的原因。

连续批处理(Continuous Batching) 是现代推理引擎的核心调度机制。传统静态批处理要求一批请求全部完成后才能接受新请求,导致 GPU 算力大量空转。连续批处理则允许在每个生成步骤(iteration)粒度上动态加入新请求、移出已完成请求,使 GPU 利用率接近满载。vLLM 将这一机制推广开来,成为行业标准。

PagedAttention 借鉴操作系统虚拟内存中分页(paging)的思想,将 KV 缓存(Key-Value Cache)切分为固定大小的"页",按需分配物理显存。传统方案需要为每个请求预分配连续显存块,导致严重的内存碎片和浪费;PagedAttention 允许不同请求甚至同一请求的不同序列共享物理页,显存利用率可提升数倍,直接转化为更高的并发批次上限,进而推高聚合吞吐。

量化(Quantization)是另一项对吞吐影响显著的技术,其核心思路是用低精度数值(如 INT8、FP8、甚至 INT4)表示模型权重和/或激活值,以减少显存占用和计算量。以 FP16 基准为参照,INT8 量化可将模型显存需求减半,同时在支持该精度的硬件(如 NVIDIA H100 的 FP8 Tensor Core)上获得更高的算术吞吐。不同量化方案在精度损失和速度收益之间存在明显差异:权重量化(W8A16)对精度影响较小,而全量化(W8A8)收益更大但需要更仔细的校准。因此,某一引擎报告的高吞吐数字,往往需要注明是否开启了量化及其精度级别,否则横向对比意义有限。

为什么推理性能成为竞争焦点

随着 LLM 从实验室走向大规模生产部署,训练之外的推理成本正成为运营支出的主要部分。对于高并发的 API 服务、Agent 工作流、以及批量数据处理场景,吞吐量的提升可以直接转化为可观的成本节约。

这也解释了为什么近年来涌现出大量专注于推理优化的开源项目和商业方案——从 vLLM、TensorRT-LLM 到各类新兴引擎,大家都在这条赛道上竞争。Nori 若能以可复现的方式验证其性能声明,将是这一趋势下的又一个有意义的样本。

如何理性看待这类性能声明

面对「百万 tok/s」这样吸引眼球的数字,务实的评估者应关注几个维度:

  • 测试透明度:是否公开了模型、硬件配置、批次大小和序列长度等完整基准参数。
  • 可复现性:能否在标准化的 benchmark(如公开数据集、固定负载)下由第三方复现。
  • 端到端指标:除峰值吞吐外,是否给出 P50/P99 延迟、首 token 时间等对实际体验更关键的指标。
  • 成本对照:每百万 token 的硬件成本相比现有方案是否有优势。

由于目前公开的信息有限,Nori 的具体实现细节、支持的模型范围以及基准测试方法仍有待进一步披露。在这些信息完善之前,将其作为一个值得跟进的技术信号更为恰当,而非直接下结论。

小结

Nori LLM 声称突破每秒百万 token,反映出推理性能优化仍是 LLM 工程领域最活跃的方向之一。对于关注部署成本的团队而言,这类项目值得持续观察,但在缺乏完整基准与可复现验证的情况下,仍需以审慎态度对待其性能主张。真正有价值的判断,来自透明的测试数据和第三方的独立验证。

分享:

相关推荐