Unverified50% confidenceBenchmarkExact time
学术界代表性Agent评测基准包括WebArena、AgentBench和ToolBench,均将执行轨迹作为核心评测维度
1
Sources
50%
Confidence
Long-term
Relevance
7/17/2026
First Seen
Sources
Related Claims
UnverifiedHumanEval、SWE-bench等代码评测基准的排名是评估执行型Agent底层模型选型的重要参考维度72% similarUnverifiedFoundry提供内置评估器,涵盖相关性、流畅性、基础性和Agent行为评估等指标71% similarUnverified当前Agent评测的探索方向包括LLM-as-Judge、轨迹相似度比对以及基于人类反馈的在线评测70% similarUnverifiedAgentic基准评测通常涉及SWE-bench、WebArena、GAIA等多个子基准的加权综合70% similarUnverified锚定样本技术在评估提示词中加入已由人类专家标注明确分数的示例,覆盖评分量表各个档位,可帮助裁判模型准确理解评分标准68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/541553API
curl https://kongchang.com/api/v1/knowledge/claims/541553MCP
get_claim(id=541553)