待验证50% 置信基准精确时间
Codex使用了126个子智能体、32500次工具调用、391次浏览器测试和2300多次单元测试;Claude Code使用35个子智能体、102次浏览器测试和296次单元测试
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/22
首次发现
有效期至:2026/11/20
来源
涉及实体
相关事实
待验证该实测任务共进行四轮,累计调度68个子智能体,完成了数字人写作技能模块的批量提示词测试72% 相似待验证阿里通义实验室推出智能体评测基准Powbench V1.0,评测包含150道真实任务与4050个测试单元,Quant 3.6 Max Preview搭配QuantPow的组合取得综合第一名66% 相似待验证ARS系统设置了25种运行模式,经过上千次测试验证,覆盖各种论文格式和引用规范66% 相似待验证在实际测试中,一次Deep Research调用了104个智能体进行定向调研,基于22个来源、59条声明完成了事实核查65% 相似待验证该评测共108项检查,分三大模块:后端API与全线65分、前端页面与真实交互25分、运行构建打包10分65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/788307API
curl https://kongchang.com/api/v1/knowledge/claims/788307MCP
get_claim(id=788307)