Unverified50% confidenceBenchmarkExact time
Codex使用了126个子智能体、32500次工具调用、391次浏览器测试和2300多次单元测试;Claude Code使用35个子智能体、102次浏览器测试和296次单元测试
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/22/2026
First Seen
Valid until: 11/20/2026
Sources
Related Entities
Related Claims
Unverified该实测任务共进行四轮,累计调度68个子智能体,完成了数字人写作技能模块的批量提示词测试72% similarUnverified阿里通义实验室推出智能体评测基准Powbench V1.0,评测包含150道真实任务与4050个测试单元,Quant 3.6 Max Preview搭配QuantPow的组合取得综合第一名66% similarUnverifiedARS系统设置了25种运行模式,经过上千次测试验证,覆盖各种论文格式和引用规范66% similarUnverified在实际测试中,一次Deep Research调用了104个智能体进行定向调研,基于22个来源、59条声明完成了事实核查65% similarUnverified该评测共108项检查,分三大模块:后端API与全线65分、前端页面与真实交互25分、运行构建打包10分65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/788307API
curl https://kongchang.com/api/v1/knowledge/claims/788307MCP
get_claim(id=788307)