待验证50% 置信事实精确时间
阿里通义实验室推出智能体评测基准Powbench V1.0,评测包含150道真实任务与4050个测试单元,Quant 3.6 Max Preview搭配QuantPow的组合取得综合第一名
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
Cursor设计模式发布与OpenAI Codex更新:AI编程工具最新动态
bilibili_AI风向标_2026/6/6
相关事实
待验证EleutherAI的Pythia项目同时公开了训练数据、代码和完整检查点序列,包含从70M到12B参数的8个规模梯度模型,全部在相同的Pile数据集上以相同顺序训练,并公开了超过150个检查点67% 相似待验证Codex使用了126个子智能体、32500次工具调用、391次浏览器测试和2300多次单元测试;Claude Code使用35个子智能体、102次浏览器测试和296次单元测试66% 相似待验证该实测任务共进行四轮,累计调度68个子智能体,完成了数字人写作技能模块的批量提示词测试65% 相似待验证Ponytail官方基准测试覆盖12个功能任务,使用Claude Code运行65% 相似待验证在测试中向智能体输入「计算 6 乘 7」的请求,模型自动调用 ai_python_executable 工具并返回结果 42,整个推理过程在 MLflow 中完整记录65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/53944API
curl https://kongchang.com/api/v1/knowledge/claims/53944MCP
get_claim(id=53944)