待验证50% 置信基准精确时间
BCG与哈佛联合研究发现,使用GPT-4进行管理咨询任务时人机协作组表现比纯人类组高出约40%,但前提是准确识别AI能力边界
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/30
首次发现
有效期至:2026/11/28
来源
涉及实体
相关事实
待验证即便是GPT-4级别的Agent,面对含有5步以上工具调用的复杂任务时,端到端成功率往往低于60%67% 相似待验证在Spider基准上,早期单模型方案准确率约为70%,GPT-4等大模型将其提升到80%以上,多智能体协作策略的系统已能达到85%甚至更高的执行准确率66% 相似已验证斯坦福大学2023年研究表明,GPT-4V等多模态模型解析嵌套条件逻辑流程图时,准确率比等效文字描述低约15-25个百分点66% 相似待验证自2023年GPT-4发布以来,AI在HumanEval等主流编程基准测试上的通过率从不足50%跃升至90%以上65% 相似待验证模型能力的代际差距正在缩小,多家模型在部分基准测试上已接近甚至超越GPT-4的推理优势64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/825517API
curl https://kongchang.com/api/v1/knowledge/claims/825517MCP
get_claim(id=825517)