Unverified50% confidenceFactExact time
随着MoE架构的普及,激活参数量与总参数量的分离使得FLOP/s阈值失去准确性,DeepSeek-V3训练消耗算力远低于其参数规模所暗示的量级
1
Sources
50%
Confidence
Long-term
Relevance
7/25/2026
First Seen
Sources
中国拟限制顶尖AI模型出海,DeepSeek同步布局自研推理芯片
bilibiliAI-seeker7/7/2026
Related Claims
Unverified算法效率的快速提升使得同等能力的模型所需计算量下降,以FLOP为唯一阈值的监管标准可能很快失去精准性75% similarUnverified混合专家架构(MoE)的应用打破了参数规模与推理速度之间的传统权衡72% similarUnverifiedPEFT技术的核心思想是不更新全部参数,而是引入少量可训练的适配器参数(如LoRA的低秩矩阵分解),降低显存和计算需求同时保留接近全量微调的效果71% similarUnverified低精度引入的数值扰动会在RL的多轮迭代中通过策略梯度的乘积形式被放大,可能导致训练崩溃或模型性能退化70% similarUnverified稀疏激活架构下推理阶段的FLOPs与激活参数规模线性相关而非与总参数规模相关,从而降低单次推理的计算资源消耗和延迟70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/611318API
curl https://kongchang.com/api/v1/knowledge/claims/611318MCP
get_claim(id=611318)