待验证50% 置信基准精确时间
SkillCascade-Bench包含213个经过验证的级联测试用例,覆盖多种智能体系统与应用领域
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/28
首次发现
有效期至:2026/12/27
来源
涉及实体
相关事实
待验证研究团队发布了配套的基准测试集SkillCascade-Bench77% 相似待验证Codex使用了126个子智能体、32500次工具调用、391次浏览器测试和2300多次单元测试;Claude Code使用35个子智能体、102次浏览器测试和296次单元测试75% 相似待验证字节跳动发布EdgeBench基准测试,用于评估自主AI Agent的长期学习能力,涵盖134个跨6大类别任务,已公开51个任务73% 相似待验证BenchLocal的测试维度包括工具调用、命令行操作、Bug识别修复、指令遵循、Hermes Agent、结构化输出、数学推理、数据提取共8大类71% 相似待验证OpenAI发布GeneBench Pro研究基准测试,包含129个评估任务,涵盖10个主要领域和21个细分方向,前沿模型最高得分31.5%70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/955502API
curl https://kongchang.com/api/v1/knowledge/claims/955502MCP
get_claim(id=955502)