待验证50% 置信观点精确时间
作者推算Mythos Preview训练消耗算力约为5e26-1e27 FLOPs,是GPT-4训练算力(约2×10^25 FLOPs)的25到50倍
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/26
首次发现
有效期至:2026/11/24
来源
涉及实体
相关事实
待验证在混合精度Adam训练中,单个参数的完整训练状态高达18字节(FP16权重2字节、FP32主权重4字节、一阶矩4字节、二阶矩4字节,加梯度)65% 相似待验证混合精度训练中,FP16 每个参数占 2 字节显存,FP32 每个参数占 4 字节显存63% 相似待验证一个rank=4的LoRA文件对于SD1.5模型约只有3-6MB,LoRA设计使训练参数量减少95%以上60% 相似待验证训练7B参数模型的全参数微调通常需要至少4张A100(80G)显卡,而LoRA使单张RTX 4090(24G)完成7B量级模型微调成为可能60% 相似待验证以 GPT-3 为例,r=4 时 LoRA 可将可训练参数从 175B 降至约 4.7M,减少约 37,000 倍59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/802780API
curl https://kongchang.com/api/v1/knowledge/claims/802780MCP
get_claim(id=802780)