[KongchangAI]
ConceptService Level Objective / 服务级别目标

SLO

SLO(服务级别目标)是SRE体系中对服务可靠性的量化承诺指标,如「99.9%的请求在200ms内成功返回」,配合错误预算使用,是衡量和管理服务可靠性的核心机制

Core Facts

Timeline (last 90 days)

Oct 7

现有P/D分离系统通常采用固定的prefill/decode worker比例,配合请求路由分配负载,在工作负载需求比例波动时会导致延迟SLO被违反

Unverified50%
Oct 3

亚马逊放弃保密协议的举措本质上是对SLO缺失风险的主动管理

Unverified50%
Oct 3

SLO无法通过行政程序一次性取得,需要通过持续透明的信息披露、社区参与和对本地关切的回应来不断维护

Unverified50%
Sep 18

基准测试的核心任务是找到在满足SLO约束条件下的最大可持续吞吐,而非系统的绝对峰值吞吐

Unverified50%
Sep 18

服务水平目标(SLO)是对服务质量的量化承诺,在LLM推理场景中通常同时包含延迟和可用性两个维度

Unverified50%
Sep 16

goodput(有效吞吐)指在满足SLO约束条件下成功完成的请求比例或吞吐量,会将超出延迟预算的请求视为失败而不计入有效输出

Unverified50%
Sep 12

Agent Reliability引入了SLO与error-budget语义,并提供可在测试/CI中使用的SLO断言

Unverified50%
Sep 11

NVIDIA建议采用自上而下的容量规划思路:明确SLO、基准测试、计算GPU总量

Unverified50%
Sep 11

误差预算是SLO与SLA之间的管理工具,将可靠性从绝对目标转化为可灵活调配的资源

Unverified50%
Sep 10

构建多模态推理服务的核心决策逻辑是先量化视觉编码在整体推理开销中的占比,再结合SLO要求和负载多样性判断分离收益

Unverified50%

4 more timeline events

All Facts (15)

Verified

推理延迟通常分解为首token延迟(TTFT)和后续token生成吞吐量两个核心指标

75%
Verified

SLI是衡量服务健康度的具体指标,SLO是团队内部设定的目标值,SLA是对外的商业承诺违反时需承担经济赔偿

65%
Unverified

现有P/D分离系统通常采用固定的prefill/decode worker比例,配合请求路由分配负载,在工作负载需求比例波动时会导致延迟SLO被违反

50%
Unverified

亚马逊放弃保密协议的举措本质上是对SLO缺失风险的主动管理

50%
Unverified

SLO无法通过行政程序一次性取得,需要通过持续透明的信息披露、社区参与和对本地关切的回应来不断维护

50%
Unverified

服务水平目标(SLO)是对服务质量的量化承诺,在LLM推理场景中通常同时包含延迟和可用性两个维度

50%
Unverified

基准测试的核心任务是找到在满足SLO约束条件下的最大可持续吞吐,而非系统的绝对峰值吞吐

50%
Unverified

goodput(有效吞吐)指在满足SLO约束条件下成功完成的请求比例或吞吐量,会将超出延迟预算的请求视为失败而不计入有效输出

50%
Unverified

Agent Reliability引入了SLO与error-budget语义,并提供可在测试/CI中使用的SLO断言

50%
Unverified

NVIDIA建议采用自上而下的容量规划思路:明确SLO、基准测试、计算GPU总量

50%
Unverified

误差预算是SLO与SLA之间的管理工具,将可靠性从绝对目标转化为可灵活调配的资源

50%
Unverified

构建多模态推理服务的核心决策逻辑是先量化视觉编码在整体推理开销中的占比,再结合SLO要求和负载多样性判断分离收益

50%
Unverified

EPD分离的适用性取决于视觉编码开销占比、多模态输入多样性和服务级别目标(SLO)三大因素

50%
Unverified

通过负载检查(load check)不等于满足了服务级别目标(SLO)

50%
Unverified

社会许可(Social License to Operate,SLO)概念源于采矿业,指企业在法律合规之外还需获得受影响社区的持续认可与信任

50%

Source Articles