待验证50% 置信事实精确时间
该评测共108项检查,分三大模块:后端API与全线65分、前端页面与真实交互25分、运行构建打包10分
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/17
首次发现
有效期至:2026/10/15
来源
相关事实
待验证Codex使用了126个子智能体、32500次工具调用、391次浏览器测试和2300多次单元测试;Claude Code使用35个子智能体、102次浏览器测试和296次单元测试65% 相似待验证阿里通义实验室推出智能体评测基准Powbench V1.0,评测包含150道真实任务与4050个测试单元,Quant 3.6 Max Preview搭配QuantPow的组合取得综合第一名63% 相似待验证在一次测试中,一个PR Review的Workflow运行了97个Agent,生成了完整的审查报告62% 相似待验证字节跳动发布EdgeBench基准测试,用于评估自主AI Agent的长期学习能力,涵盖134个跨6大类别任务,已公开51个任务62% 相似待验证Code Review skill会开启全新session以保持AI干净状态检查,并将来自《重构》的12种代码异味写成具体检查清单62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/547402API
curl https://kongchang.com/api/v1/knowledge/claims/547402MCP
get_claim(id=547402)