Unverified50% confidenceOpinionExact time
作者推算Mythos Preview训练消耗算力约为5e26-1e27 FLOPs,是GPT-4训练算力(约2×10^25 FLOPs)的25到50倍
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/26/2026
First Seen
Valid until: 11/24/2026
Sources
Related Entities
Related Claims
Unverified在混合精度Adam训练中,单个参数的完整训练状态高达18字节(FP16权重2字节、FP32主权重4字节、一阶矩4字节、二阶矩4字节,加梯度)65% similarUnverified混合精度训练中,FP16 每个参数占 2 字节显存,FP32 每个参数占 4 字节显存63% similarUnverified一个rank=4的LoRA文件对于SD1.5模型约只有3-6MB,LoRA设计使训练参数量减少95%以上60% similarUnverified训练7B参数模型的全参数微调通常需要至少4张A100(80G)显卡,而LoRA使单张RTX 4090(24G)完成7B量级模型微调成为可能60% similarUnverified以 GPT-3 为例,r=4 时 LoRA 可将可训练参数从 175B 降至约 4.7M,减少约 37,000 倍59% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/802780API
curl https://kongchang.com/api/v1/knowledge/claims/802780MCP
get_claim(id=802780)