待验证50% 置信事实精确时间
随着MoE架构的普及,激活参数量与总参数量的分离使得FLOP/s阈值失去准确性,DeepSeek-V3训练消耗算力远低于其参数规模所暗示的量级
1
来源数
50%
置信度
长期有效
时效性
2026/7/25
首次发现
来源
中国拟限制顶尖AI模型出海,DeepSeek同步布局自研推理芯片
bilibiliAI-seeker2026/7/7
相关事实
待验证算法效率的快速提升使得同等能力的模型所需计算量下降,以FLOP为唯一阈值的监管标准可能很快失去精准性75% 相似待验证混合专家架构(MoE)的应用打破了参数规模与推理速度之间的传统权衡72% 相似待验证PEFT技术的核心思想是不更新全部参数,而是引入少量可训练的适配器参数(如LoRA的低秩矩阵分解),降低显存和计算需求同时保留接近全量微调的效果71% 相似待验证低精度引入的数值扰动会在RL的多轮迭代中通过策略梯度的乘积形式被放大,可能导致训练崩溃或模型性能退化70% 相似待验证稀疏激活架构下推理阶段的FLOPs与激活参数规模线性相关而非与总参数规模相关,从而降低单次推理的计算资源消耗和延迟70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/611318API
curl https://kongchang.com/api/v1/knowledge/claims/611318MCP
get_claim(id=611318)