YaRN
一种基于RoPE的上下文长度外推技术,可在不重新训练模型的情况下扩展模型的有效上下文窗口长度
Core Facts
Timeline (last 90 days)
YaRN(Yet another RoPE extensioN)是一种针对旋转位置编码(RoPE)的扩展方法,由Bowen Peng等人于2023年提出,通过对高频、中频、低频分量分别采用差异化缩放策略,使模型无需重新训练或仅需少量微调即可将有效上下文长度扩展数倍
Qwen3.8 Flash Next 原生上下文窗口为26.2万token,借助YaRN技术可扩展至100万token
YaRN(Yet another RoPE extensioN method)是2023年提出的位置编码扩展技术,通过动态调整位置编码频率分量使模型处理比训练时更长的序列
Qwen3.8 Flash Next原生支持文本、图像和视频多模态处理,原生上下文窗口达26.2万token,借助YaRN技术可扩展至100万token
模型原生支持256K Token上下文,可通过YaRN技术实现4倍缩放扩展至约100万Token
YaRN 对 RoPE 的频率分量进行分组缩放,对高频分量保持不变以保留局部位置精度,对低频分量进行插值以适应更长上下文,并引入温度缩放因子
YaRN是针对旋转位置编码(RoPE)的扩展方法,由Bowen Peng等人于2023年提出,通过对不同频率分量采用差异化缩放策略扩展上下文长度
Qwen3 27B 原生支持 26.2 万 Token 上下文,并能通过 YaRN 外推到 100 万 Token
YaRN通过对RoPE中不同频率分量采用差异化的缩放策略,使模型能够在无需重新训练或仅需少量微调的情况下将有效上下文长度扩展数倍甚至数十倍
YaRN方法通过对不同频率分量采用差异化缩放策略,扩展有效上下文长度同时保持短距离位置关系精度
3 more timeline events
All Facts (14)
pnpm通过硬链接和符号链接机制实现依赖的全局共享存储,相比npm和yarn大幅减少磁盘占用和安装时间
65%UnverifiedYaRN(Yet another RoPE extensioN)是一种针对旋转位置编码(RoPE)的扩展方法,由Bowen Peng等人于2023年提出,通过对高频、中频、低频分量分别采用差异化缩放策略,使模型无需重新训练或仅需少量微调即可将有效上下文长度扩展数倍
50%UnverifiedQwen3.8 Flash Next 原生上下文窗口为26.2万token,借助YaRN技术可扩展至100万token
50%UnverifiedYaRN(Yet another RoPE extensioN method)是2023年提出的位置编码扩展技术,通过动态调整位置编码频率分量使模型处理比训练时更长的序列
50%UnverifiedQwen3.8 Flash Next原生支持文本、图像和视频多模态处理,原生上下文窗口达26.2万token,借助YaRN技术可扩展至100万token
50%Unverified模型原生支持256K Token上下文,可通过YaRN技术实现4倍缩放扩展至约100万Token
50%UnverifiedYaRN 对 RoPE 的频率分量进行分组缩放,对高频分量保持不变以保留局部位置精度,对低频分量进行插值以适应更长上下文,并引入温度缩放因子
50%UnverifiedYaRN是针对旋转位置编码(RoPE)的扩展方法,由Bowen Peng等人于2023年提出,通过对不同频率分量采用差异化缩放策略扩展上下文长度
50%UnverifiedQwen3 27B 原生支持 26.2 万 Token 上下文,并能通过 YaRN 外推到 100 万 Token
50%UnverifiedYaRN通过对RoPE中不同频率分量采用差异化的缩放策略,使模型能够在无需重新训练或仅需少量微调的情况下将有效上下文长度扩展数倍甚至数十倍
50%UnverifiedYaRN方法通过对不同频率分量采用差异化缩放策略,扩展有效上下文长度同时保持短距离位置关系精度
50%UnverifiedFEIHOA服务通过YaRN技术扩展上下文,实现了1M(百万级)token的上下文支持
50%UnverifiedYaRN是一种针对使用RoPE的Transformer模型的上下文窗口扩展方法,通过对不同频率维度采用差异化缩放策略,无需完整微调即可扩展上下文
50%Unverified业界采用旋转位置编码(RoPE)及其外推方法(如YaRN、NTK-aware scaling)、FlashAttention、稀疏注意力等技术应对长上下文挑战
50%