待验证50% 置信事实精确时间
BERT的MLM是一步到位的预测且主要用于表征学习,而离散扩散模型将mask比例作为从0%到100%的连续变量构建完整马尔可夫链,通过多步迭代实现渐进式生成
1
来源数
50%
置信度
长期有效
时效性
2026/9/1
首次发现
来源
涉及实体
相关事实
待验证MTP通过在模型输出层增加多个预测头,使模型在一次前向传播中同时预测未来N个token的概率分布,可在不损失生成质量的前提下实现2-4倍推理加速68% 相似待验证每次前向传播生成token时,模型都需经过完整的多头注意力计算和前馈网络层,计算量由模型参数规模决定68% 相似待验证回归用于预测连续型数值,是监督学习中最基础的部分67% 相似待验证BERT-base 拥有约 1.1 亿参数,采用掩码语言模型(MLM)和下一句预测(NSP)两种自监督预训练目标,MLM 随机遮蔽输入文本中 15% 的词元66% 相似待验证MLP层充当模型的长期事实记忆库,其键值对是预训练阶段固化在权重中的静态参数66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/837835API
curl https://kongchang.com/api/v1/knowledge/claims/837835MCP
get_claim(id=837835)