待验证50% 置信事实精确时间
Agent Reliability将评测器自身的执行失败与Agent的失败严格区分,并将测量健康度与Agent可靠性分开追踪
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证Agent Reliability的核心思路是把SRE(站点可靠性工程)的可靠性度量方法迁移到AI Agent评测中78% 相似待验证衡量Agent长程可靠性的核心指标包括任务成功率、工具调用准确率、恢复率、单次成功任务成本和人工干预次数77% 相似待验证Agent Reliability的基础包零强制运行时依赖,并内置确定性评测器76% 相似待验证Agent可靠性验证方法论包括:每个任务重复运行10次以上、以程序化方式检查最终状态、对每次工具调用按schema校验、统计高负载下被截断的调用数量74% 相似待验证由于Agent输出具有不确定性,其测试需要设计评估指标(如准确率、任务完成率、延迟)并通过批量测试用例验证稳定性73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/916847API
curl https://kongchang.com/api/v1/knowledge/claims/916847MCP
get_claim(id=916847)