Unverified50% confidenceBenchmarkExact time
SkillCascade-Bench包含213个经过验证的级联测试用例,覆盖多种智能体系统与应用领域
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/28/2026
First Seen
Valid until: 12/27/2026
Sources
Related Entities
Related Claims
Unverified研究团队发布了配套的基准测试集SkillCascade-Bench77% similarUnverifiedCodex使用了126个子智能体、32500次工具调用、391次浏览器测试和2300多次单元测试;Claude Code使用35个子智能体、102次浏览器测试和296次单元测试75% similarUnverified字节跳动发布EdgeBench基准测试,用于评估自主AI Agent的长期学习能力,涵盖134个跨6大类别任务,已公开51个任务73% similarUnverifiedBenchLocal的测试维度包括工具调用、命令行操作、Bug识别修复、指令遵循、Hermes Agent、结构化输出、数学推理、数据提取共8大类71% similarUnverifiedOpenAI发布GeneBench Pro研究基准测试,包含129个评估任务,涵盖10个主要领域和21个细分方向,前沿模型最高得分31.5%70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/955502API
curl https://kongchang.com/api/v1/knowledge/claims/955502MCP
get_claim(id=955502)