Unverified50% confidenceFactExact time
DiffusionGemma依赖双向注意力(去掉因果注意力的下三角掩码),使每个位置能同时关注序列中前后所有位置
1
Sources
50%
Confidence
Long-term
Relevance
8/27/2026
First Seen
Sources
Related Entities
Related Claims
Unverified将自回归基座改造为扩散模型通常涉及将因果注意力掩码替换为双向注意力,并引入噪声调度器和时间步嵌入69% similarUnverifiedTransformer架构中的因果掩码在注意力矩阵中将未来位置置零,从结构层面强制实现单向因果性,既支持训练时并行处理,又在推理时保持时间因果顺序68% similarUnverifiedTransformer的自注意力机制通过Query-Key-Value矩阵运算决定每个token关注哪些其他token,注意力权重是总和为1的概率分布68% similarUnverified自注意力机制通过将输入序列线性变换为Query、Key、Value三个矩阵,注意力权重由Q与K的转置相乘后经Softmax归一化得到,再与V相乘得到输出67% similarUnverifiedHadamard乘积聚类方法具备迁移至Transformer注意力机制或前馈层分析的潜力64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/807339API
curl https://kongchang.com/api/v1/knowledge/claims/807339MCP
get_claim(id=807339)