Unverified50% confidenceFactExact time
BERT的MLM是一步到位的预测且主要用于表征学习,而离散扩散模型将mask比例作为从0%到100%的连续变量构建完整马尔可夫链,通过多步迭代实现渐进式生成
1
Sources
50%
Confidence
Long-term
Relevance
9/1/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedMTP通过在模型输出层增加多个预测头,使模型在一次前向传播中同时预测未来N个token的概率分布,可在不损失生成质量的前提下实现2-4倍推理加速68% similarUnverified每次前向传播生成token时,模型都需经过完整的多头注意力计算和前馈网络层,计算量由模型参数规模决定68% similarUnverified回归用于预测连续型数值,是监督学习中最基础的部分67% similarUnverifiedBERT-base 拥有约 1.1 亿参数,采用掩码语言模型(MLM)和下一句预测(NSP)两种自监督预训练目标,MLM 随机遮蔽输入文本中 15% 的词元66% similarUnverifiedMLP层充当模型的长期事实记忆库,其键值对是预训练阶段固化在权重中的静态参数66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/837835API
curl https://kongchang.com/api/v1/knowledge/claims/837835MCP
get_claim(id=837835)