待验证50% 置信基准精确时间
接受率随位置逐级衰减:GSM8K从位置0的0.92下滑至约0.53,MTBench从0.78急跌至0.13,因误差在连续猜测中累积
1
来源数
50%
置信度
长期有效
时效性
2026/7/9
首次发现
来源
DeepSeek DSpec实测:推测性解码如何将大模型推理提速6倍
bilibili程序员-智能译站2026/7/8
相关事实
待验证任务的输出熵越低(答案越可预测),推测性解码的加速效益越显著;GSM8K接受率从位置0的0.92衰减至0.53,MTBench从0.78急跌至0.1383% 相似待验证研究表明,即使在 GSM8K 或 MATH 数据集上接近满分的模型,面对稍作变形或需要跨领域组合的问题时性能下降可达30-50个百分点70% 相似待验证最优变体在GSM8K数学推理基准仅下降1.83%,MMLU综合知识基准保持不变70% 相似待验证发布的checkpoint按块大小16训练,若将采样块大小改为64,HumanEval从76%跌至约20%,GSM8K从高位跌到2.2%66% 相似待验证GitHub Copilot满意度已降到9%,远低于Claude Code的46%和Cursor的19%63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/362552API
curl https://kongchang.com/api/v1/knowledge/claims/362552MCP
get_claim(id=362552)