待验证50% 置信基准精确时间
把上下文从256 token扩展到2,048 token后,在FEVEROUS上固定答案条件下的证据增益分别提升了3.84(Qwen)和3.10(Llama)个百分点
1
来源数
50%
置信度
长期有效
时效性
2026/9/24
首次发现
来源
涉及实体
相关事实
待验证投机采样中当候选 token 的接受率较高时,每次前向传播的有效输出 token 数量可达 2~4 个,从而将整体生成速度提升 1.5x~3x71% 相似待验证Qwen2.5-Max-0902最大输出为13万Token,推理模式下上限可达26万Token65% 相似待验证在Artificial Analysis同轮评测中 Qwen 3.8 生成约1.6亿Token,而同级开放模型中位数为4300万Token65% 相似待验证标准注意力机制的计算复杂度为O(n²),序列长度翻倍时计算量增加四倍,这是早期GPT-3仅支持4K Token的根本原因65% 相似待验证在259k吞吐量下Qwen3.5速度提升约19倍,其中混合注意力贡献约5倍、MoE稀疏化约2倍、多Token预测约1.5倍64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/946281API
curl https://kongchang.com/api/v1/knowledge/claims/946281MCP
get_claim(id=946281)