待验证50% 置信事实精确时间
GPT-3 的预训练语料以自然语言为主,代码仅占约 1%,而 Codex 的微调数据集中代码占比超过 90%
1
来源数
50%
置信度
长期有效
时效性
2026/7/6
首次发现
来源
Codex CLI 实战指南:从入门配置到企业级AI编程开发
bilibiliAI大模型技术教程2026/7/3
相关事实
待验证The early GPT-3 model demonstrated some code comprehension ability, but its training data was primarily natural language, limiting the accuracy and engineering practicality of its code generation.80% 相似待验证Codex在GPT-3基础上使用约1540亿token的公开代码库数据(涵盖54种编程语言)进行微调,在HumanEval基准的pass@1准确率达28.8%,而同期GPT-3为0%75% 相似已验证GPT-4、Claude 3、Gemini等现代大语言模型通过在海量代码语料库上预训练,已能理解自然语言描述并生成高质量可运行代码73% 相似待验证谷歌DeepMind的研究发现GPT类模型在特定提示条件下可精确复现训练集中约1%的文本片段72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/114747API
curl https://kongchang.com/api/v1/knowledge/claims/114747MCP
get_claim(id=114747)