待验证50% 置信事实精确时间
GPT-4和Claude等前沿模型在代码生成任务中的首次通过率(Pass@1)通常在60%-80%之间,意味着每5次修改中可能有1-2次存在问题
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
Claude Code四个实用指令,让AI编程效率翻倍
bilibiliopenclaw养成记2026/6/3
相关事实
待验证GPT-4和Claude 3在HumanEval代码基准测试上的pass@1通过率超过85%77% 相似部分验证三个 GPT-5.6 模型在长程代理微调任务上均拿满分 10 分,而 GPT-5.5 和 Opus 4.7 在该任务只能拿两三分73% 相似待验证对于最难的编码任务,目前GPT 5.5和Opus 4.8大约各占50%的使用比例,而几个月前Anthropic的模型占据明显优势73% 相似待验证以GPT-4为例,单次复杂Agent任务可能涉及5-20次LLM调用72% 相似待验证斯坦福大学2024年的AgentBench基准测试显示,GPT-4级别模型在需要跨系统协调的复杂任务中端到端成功率低于30%72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/52890API
curl https://kongchang.com/api/v1/knowledge/claims/52890MCP
get_claim(id=52890)