Unverified50% confidenceBenchmarkExact time
三个前沿模型的任务成功率非常接近,都在84%–89%之间
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/11/2026
First Seen
Valid until: 12/10/2026
Sources
Related Entities
Related Claims
Unverified当前顶级模型的单步准确率约在90%至95%之间68% similarUnverifiedClaude 3 Opus等模型在部分编程任务上通过率超过85%67% similarUnverified在旅行规划任务中,2024年初的模型成功率接近0%,但在工具辅助下GPT-4和Claude 3可以达到90%以上的正确率66% similarUnverified用旗舰模型蒸馏出的小模型在特定任务上可以达到旗舰模型90%以上的性能66% similarUnverified在Spider基准上,早期单模型方案准确率约为70%,GPT-4等大模型将其提升到80%以上,多智能体协作策略的系统已能达到85%甚至更高的执行准确率65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/907729API
curl https://kongchang.com/api/v1/knowledge/claims/907729MCP
get_claim(id=907729)