Unverified50% confidenceBenchmarkExact time
初版 Codex 采用约120亿参数规模,在 HumanEval 基准测试中达到 28.8% 的 pass@1 通过率
1
Sources
50%
Confidence
Long-term
Relevance
7/23/2026
First Seen
Sources
Related Claims
VerifiedCodex在HumanEval基准测试上达到了28.8%的pass@1准确率83% similarUnverified早期Codex在HumanEval基准测试中以37%的准确率独立解决编程题,达到当时最高水平72% similarUnverifiedCodex于2021年发布时在HumanEval基准上达到28.8%的pass@1得分,而GPT-4在同一基准上已超过67%69% similarUnverified初代Codex在HumanEval基准测试上的pass@1指标达到28.8%,而直接使用GPT-3仅为0%68% similarUnverifiedClaude 3.5 Sonnet在HumanEval基准测试上的得分超过90%,而2021年最初的Codex模型得分仅为28.8%65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/596140API
curl https://kongchang.com/api/v1/knowledge/claims/596140MCP
get_claim(id=596140)