Unverified50% confidenceFactExact time
GPT-3 的预训练语料以自然语言为主,代码仅占约 1%,而 Codex 的微调数据集中代码占比超过 90%
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
Codex CLI 实战指南:从入门配置到企业级AI编程开发
bilibiliAI大模型技术教程7/3/2026
Related Claims
UnverifiedThe early GPT-3 model demonstrated some code comprehension ability, but its training data was primarily natural language, limiting the accuracy and engineering practicality of its code generation.80% similarUnverifiedCodex在GPT-3基础上使用约1540亿token的公开代码库数据(涵盖54种编程语言)进行微调,在HumanEval基准的pass@1准确率达28.8%,而同期GPT-3为0%75% similarVerifiedGPT-4、Claude 3、Gemini等现代大语言模型通过在海量代码语料库上预训练,已能理解自然语言描述并生成高质量可运行代码73% similarUnverified谷歌DeepMind的研究发现GPT类模型在特定提示条件下可精确复现训练集中约1%的文本片段72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/114747API
curl https://kongchang.com/api/v1/knowledge/claims/114747MCP
get_claim(id=114747)