Agent Reliability
专注于衡量AI Agent可靠性的开源Python SDK,将SRE(站点可靠性工程)中的可靠性度量方法迁移到Agent评测场景,支持SLO断言、错误预算追踪和CI集成
时间轴 (近 90 天)
Agent Reliability是一个专注于衡量AI Agent可靠性的开源Python SDK
Agent Reliability的核心思路是把SRE(站点可靠性工程)的可靠性度量方法迁移到AI Agent评测中
Agent Reliability引入PASS、FAIL、UNKNOWN三种显式结果状态
在Agent Reliability中,UNKNOWN状态不会人为拉低可靠性分数
Agent Reliability将评测器自身的执行失败与Agent的失败严格区分,并将测量健康度与Agent可靠性分开追踪
Agent Reliability引入了SLO与error-budget语义,并提供可在测试/CI中使用的SLO断言
Agent Reliability采用本地优先(local-first)路线,不需要注册账号、API Key或托管服务
Agent Reliability的基础包零强制运行时依赖,并内置确定性评测器
Agent Reliability提供可选的OpenTelemetry互操作能力
Agent Reliability可通过pip install agent-reliability安装,并已发布至PyPI
还有 1 条时间轴事件
全部知识事实 (10)
Agent Reliability是一个专注于衡量AI Agent可靠性的开源Python SDK
50%待验证Agent Reliability的核心思路是把SRE(站点可靠性工程)的可靠性度量方法迁移到AI Agent评测中
50%待验证Agent Reliability引入PASS、FAIL、UNKNOWN三种显式结果状态
50%待验证在Agent Reliability中,UNKNOWN状态不会人为拉低可靠性分数
50%待验证Agent Reliability将评测器自身的执行失败与Agent的失败严格区分,并将测量健康度与Agent可靠性分开追踪
50%待验证Agent Reliability引入了SLO与error-budget语义,并提供可在测试/CI中使用的SLO断言
50%待验证Agent Reliability采用本地优先(local-first)路线,不需要注册账号、API Key或托管服务
50%待验证Agent Reliability的基础包零强制运行时依赖,并内置确定性评测器
50%待验证Agent Reliability提供可选的OpenTelemetry互操作能力
50%待验证Agent Reliability可通过pip install agent-reliability安装,并已发布至PyPI
50%