ConceptPositional Encoding / 位置嵌入
位置编码
Transformer模型中用于赋予模型感知token序列位置能力的关键机制,主要方案包括固定正弦余弦编码、可学习绝对位置嵌入及RoPE等相对位置编码,不同方案在长度外推能力上存在显著差异
Core Facts
Timeline (last 90 days)
Oct 7
传统正弦/余弦位置编码针对均匀整数步长设计,难以表达不规则间隔的几何关系
Unverified50%
Sep 29
位置编码用于向模型注入词序信息,因为注意力机制本身不区分位置顺序
Unverified50%
Sep 16
位置编码(Positional Encoding)通过给每个词附加位置信息,解决注意力机制本身无序、不知道词先后顺序的问题
Unverified50%
Sep 11
Transformer使用正弦和余弦函数的位置编码,波长按几何级数排开,最短和最长差一万倍
Unverified50%
Sep 11
输入模型的向量等于词向量加位置向量,例如7个字会生成7个词向量和7个位置向量相加得到真实输入
Unverified50%
Jul 19
由于Transformer自注意力机制存在位置偏向性,早期输入内容对后续生成具有更强锚定作用,这是系统提示上下文锚定效应的底层原因
Verified65%
All Facts (6)
Verified
由于Transformer自注意力机制存在位置偏向性,早期输入内容对后续生成具有更强锚定作用,这是系统提示上下文锚定效应的底层原因
65%Unverified传统正弦/余弦位置编码针对均匀整数步长设计,难以表达不规则间隔的几何关系
50%Unverified位置编码用于向模型注入词序信息,因为注意力机制本身不区分位置顺序
50%Unverified位置编码(Positional Encoding)通过给每个词附加位置信息,解决注意力机制本身无序、不知道词先后顺序的问题
50%UnverifiedTransformer使用正弦和余弦函数的位置编码,波长按几何级数排开,最短和最长差一万倍
50%Unverified输入模型的向量等于词向量加位置向量,例如7个字会生成7个词向量和7个位置向量相加得到真实输入
50%