Unverified50% confidenceBenchmarkExact time
BCG与哈佛联合研究发现,使用GPT-4进行管理咨询任务时人机协作组表现比纯人类组高出约40%,但前提是准确识别AI能力边界
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/30/2026
First Seen
Valid until: 11/28/2026
Sources
Related Entities
Related Claims
Unverified即便是GPT-4级别的Agent,面对含有5步以上工具调用的复杂任务时,端到端成功率往往低于60%67% similarUnverified在Spider基准上,早期单模型方案准确率约为70%,GPT-4等大模型将其提升到80%以上,多智能体协作策略的系统已能达到85%甚至更高的执行准确率66% similarVerified斯坦福大学2023年研究表明,GPT-4V等多模态模型解析嵌套条件逻辑流程图时,准确率比等效文字描述低约15-25个百分点66% similarUnverified自2023年GPT-4发布以来,AI在HumanEval等主流编程基准测试上的通过率从不足50%跃升至90%以上65% similarUnverified模型能力的代际差距正在缩小,多家模型在部分基准测试上已接近甚至超越GPT-4的推理优势64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/825517API
curl https://kongchang.com/api/v1/knowledge/claims/825517MCP
get_claim(id=825517)