待验证50% 置信事实精确时间
Beam预训练使用6144块英伟达GB300 NVL72,用时不到4周,消耗23.8万亿个token
1
来源数
50%
置信度
长期有效
时效性
2026/10/8
首次发现
来源
涉及实体
相关事实
待验证Beam的强化学习阶段使用1500块GB300连跑四周,生成超过一亿条rollout,最长上下文到256K76% 相似待验证开发者公布在RTX 3050 Laptop(4GB)上微调Llama-3.1-8B的实测结果为训练速度119.6 tok/s,峰值显存3.32 GB62% 相似待验证测试者用双4090(48GB显存)工作站运行20.7B稠密模型,每秒生成27.6个Token,仅比矮星略快,但参数量小10倍以上60% 相似待验证GPT-4级别模型的首Token延迟(TTFT)可达500-2000ms,而Llama 3.1 8B等小模型TTFT可低至100-300ms59% 相似待验证训练一个800B激活模型需要约五万张GB300,换成华为最新的卡需要20万张59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/987286API
curl https://kongchang.com/api/v1/knowledge/claims/987286MCP
get_claim(id=987286)