待验证50% 置信事实精确时间
GPT-3有175B参数、训练300B token,Gopher有280B参数、训练300B token,均属于过参数化欠训练状态
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
已验证Claude 3.5 Sonnet支持200K token上下文,GPT-4 Turbo支持100K token上下文67% 相似待验证以 GPT-3 为例,r=4 时 LoRA 可将可训练参数从 175B 降至约 4.7M,减少约 37,000 倍66% 相似待验证LLaMA系列采用过度训练策略,以7B参数训练了1T token,远超Chinchilla最优配比的140B token66% 相似待验证千问3.8 27B基于千问3.5的整套架构体系,架构层面与3.5完全一致,仅做了继续预训练和后训练(含SFT与RL强化)65% 相似待验证微软的Phi-3仅3.8B参数但在多项基准测试中性能媲美早期GPT-4级别的模型64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/895883API
curl https://kongchang.com/api/v1/knowledge/claims/895883MCP
get_claim(id=895883)