SLO
SLO(服务级别目标)是SRE体系中对服务可靠性的量化承诺指标,如「99.9%的请求在200ms内成功返回」,配合错误预算使用,是衡量和管理服务可靠性的核心机制
Core Facts
Timeline (last 90 days)
现有P/D分离系统通常采用固定的prefill/decode worker比例,配合请求路由分配负载,在工作负载需求比例波动时会导致延迟SLO被违反
亚马逊放弃保密协议的举措本质上是对SLO缺失风险的主动管理
SLO无法通过行政程序一次性取得,需要通过持续透明的信息披露、社区参与和对本地关切的回应来不断维护
基准测试的核心任务是找到在满足SLO约束条件下的最大可持续吞吐,而非系统的绝对峰值吞吐
服务水平目标(SLO)是对服务质量的量化承诺,在LLM推理场景中通常同时包含延迟和可用性两个维度
goodput(有效吞吐)指在满足SLO约束条件下成功完成的请求比例或吞吐量,会将超出延迟预算的请求视为失败而不计入有效输出
Agent Reliability引入了SLO与error-budget语义,并提供可在测试/CI中使用的SLO断言
NVIDIA建议采用自上而下的容量规划思路:明确SLO、基准测试、计算GPU总量
误差预算是SLO与SLA之间的管理工具,将可靠性从绝对目标转化为可灵活调配的资源
构建多模态推理服务的核心决策逻辑是先量化视觉编码在整体推理开销中的占比,再结合SLO要求和负载多样性判断分离收益
4 more timeline events
All Facts (15)
推理延迟通常分解为首token延迟(TTFT)和后续token生成吞吐量两个核心指标
75%VerifiedSLI是衡量服务健康度的具体指标,SLO是团队内部设定的目标值,SLA是对外的商业承诺违反时需承担经济赔偿
65%Unverified现有P/D分离系统通常采用固定的prefill/decode worker比例,配合请求路由分配负载,在工作负载需求比例波动时会导致延迟SLO被违反
50%Unverified亚马逊放弃保密协议的举措本质上是对SLO缺失风险的主动管理
50%UnverifiedSLO无法通过行政程序一次性取得,需要通过持续透明的信息披露、社区参与和对本地关切的回应来不断维护
50%Unverified服务水平目标(SLO)是对服务质量的量化承诺,在LLM推理场景中通常同时包含延迟和可用性两个维度
50%Unverified基准测试的核心任务是找到在满足SLO约束条件下的最大可持续吞吐,而非系统的绝对峰值吞吐
50%Unverifiedgoodput(有效吞吐)指在满足SLO约束条件下成功完成的请求比例或吞吐量,会将超出延迟预算的请求视为失败而不计入有效输出
50%UnverifiedAgent Reliability引入了SLO与error-budget语义,并提供可在测试/CI中使用的SLO断言
50%UnverifiedNVIDIA建议采用自上而下的容量规划思路:明确SLO、基准测试、计算GPU总量
50%Unverified误差预算是SLO与SLA之间的管理工具,将可靠性从绝对目标转化为可灵活调配的资源
50%Unverified构建多模态推理服务的核心决策逻辑是先量化视觉编码在整体推理开销中的占比,再结合SLO要求和负载多样性判断分离收益
50%UnverifiedEPD分离的适用性取决于视觉编码开销占比、多模态输入多样性和服务级别目标(SLO)三大因素
50%Unverified通过负载检查(load check)不等于满足了服务级别目标(SLO)
50%Unverified社会许可(Social License to Operate,SLO)概念源于采矿业,指企业在法律合规之外还需获得受影响社区的持续认可与信任
50%