待验证50% 置信基准精确时间
在WebShop决策任务中,ReAct得分66.6,超越模仿学习基线,但低于人类专家的82.1
1
来源数
50%
置信度
长期有效
时效性
2026/9/9
首次发现
来源
涉及实体
相关事实
待验证WebArena和Mind2Web等基准测试表明,当前最强的Web智能体在复杂网页任务上的成功率仍低于50%68% 相似待验证Long-Term团队实验表明,用同一个模型仅调整规则约束和记忆系统,成绩从52.8%涨到66.5%,排名从Top 30跳到Top 565% 相似待验证2023年的多项Benchmark测试(如HaHackathon数据集)显示,顶级LLM在讽刺识别任务上的准确率仍显著低于普通人类标注者63% 相似待验证在BrowseWebApp Bench基准上,微调后模型的准确率从22%提升至63%62% 相似待验证在同一复现实验中,ResNet-20测试准确率为90.4%,ResNet-56测试准确率为91.7%,训练准确率分别为97.4%和99.0%61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/884336API
curl https://kongchang.com/api/v1/knowledge/claims/884336MCP
get_claim(id=884336)