待验证50% 置信事实精确时间
Agent Reliability引入了SLO与error-budget语义,并提供可在测试/CI中使用的SLO断言
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证Agent Reliability的核心思路是把SRE(站点可靠性工程)的可靠性度量方法迁移到AI Agent评测中66% 相似待验证SWE-bench基准测试已成为评估AI Agent代码能力的行业标准,包含从真实GitHub仓库中提取的软件工程任务64% 相似待验证测试目标是名为ExploitGym的网络安全基准测试,用于评估AI模型的网络安全能力63% 相似待验证Agent可靠性验证方法论包括:每个任务重复运行10次以上、以程序化方式检查最终状态、对每次工具调用按schema校验、统计高负载下被截断的调用数量62% 相似待验证Agent测试的五大核心维度为命令安全性、工具调用准确性、任务规划合理性、输出一致性和错误自我修复62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/916848API
curl https://kongchang.com/api/v1/knowledge/claims/916848MCP
get_claim(id=916848)