Unverified50% confidenceFactExact time
GPT-3有175B参数、训练300B token,Gopher有280B参数、训练300B token,均属于过参数化欠训练状态
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
VerifiedClaude 3.5 Sonnet支持200K token上下文,GPT-4 Turbo支持100K token上下文67% similarUnverified以 GPT-3 为例,r=4 时 LoRA 可将可训练参数从 175B 降至约 4.7M,减少约 37,000 倍66% similarUnverifiedLLaMA系列采用过度训练策略,以7B参数训练了1T token,远超Chinchilla最优配比的140B token66% similarUnverified千问3.8 27B基于千问3.5的整套架构体系,架构层面与3.5完全一致,仅做了继续预训练和后训练(含SFT与RL强化)65% similarUnverified微软的Phi-3仅3.8B参数但在多项基准测试中性能媲美早期GPT-4级别的模型64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/895883API
curl https://kongchang.com/api/v1/knowledge/claims/895883MCP
get_claim(id=895883)