Unverified50% confidenceFactExact time
GPT-4和Claude等前沿模型在代码生成任务中的首次通过率(Pass@1)通常在60%-80%之间,意味着每5次修改中可能有1-2次存在问题
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Claude Code四个实用指令,让AI编程效率翻倍
bilibiliopenclaw养成记6/3/2026
Related Claims
UnverifiedGPT-4和Claude 3在HumanEval代码基准测试上的pass@1通过率超过85%77% similarPartially Verified三个 GPT-5.6 模型在长程代理微调任务上均拿满分 10 分,而 GPT-5.5 和 Opus 4.7 在该任务只能拿两三分73% similarUnverified对于最难的编码任务,目前GPT 5.5和Opus 4.8大约各占50%的使用比例,而几个月前Anthropic的模型占据明显优势73% similarUnverified以GPT-4为例,单次复杂Agent任务可能涉及5-20次LLM调用72% similarUnverified斯坦福大学2024年的AgentBench基准测试显示,GPT-4级别模型在需要跨系统协调的复杂任务中端到端成功率低于30%72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/52890API
curl https://kongchang.com/api/v1/knowledge/claims/52890MCP
get_claim(id=52890)