Swift-1.5-Qwen3.8-Flash-Next
UkisAI团队基于强化学习训练的本地推理模型,以Qwen3.8为基础,通过对Chain-of-Thought长度施加惩罚信号,在不损失答案正确率的前提下大幅缩短推理步骤,显著降低token消耗和推理耗时
时间轴 (近 90 天)
Swift版在保持几乎同等质量的前提下,把推理token消耗和耗时都压缩到了基础版Qwen3.8-Flash-Next的40%左右
在Aider基准中,Swift-1.5-Flash-Next (xhigh)首次通过率为41.1%,略高于Qwen3.8-Flash-Next的40.2%
测试者认为在该规模数据集上只有约5%以上的差异才具备统计意义,而实际差距不足4%,尚未达到显著水平
Swift系列模型由UkisAI团队基于强化学习训练,对推理模型的思考链长度施加惩罚信号以缩短内部推理步骤
Swift的优化发生在推理行为层面,模型参数量不变,这与针对模型权重的蒸馏或量化压缩手段有本质区别
在基础版消耗token最多的20次运行对比中,Swift只用了29%的token却解出16题,与基础版的17题几乎持平
Swift在任何单个案例上最多用44K token,而基础版最高达到203K token
在C++语言测试中Swift的token用量仅为基础版的29%,但6次质量损失中占了3次
对于重度C++开发者,Swift激进的推理压缩带来质量波动,建议适当放宽推理预算以求稳
配对统计(n=107)显示99例一致、2例Swift更优、6例更差,McNemar精确检验p≈0.29,两者质量统计上难以区分
还有 2 条时间轴事件
全部知识事实 (12)
Swift版在保持几乎同等质量的前提下,把推理token消耗和耗时都压缩到了基础版Qwen3.8-Flash-Next的40%左右
50%待验证在Aider基准中,Swift-1.5-Flash-Next (xhigh)首次通过率为41.1%,略高于Qwen3.8-Flash-Next的40.2%
50%待验证测试者认为在该规模数据集上只有约5%以上的差异才具备统计意义,而实际差距不足4%,尚未达到显著水平
50%待验证Swift系列模型由UkisAI团队基于强化学习训练,对推理模型的思考链长度施加惩罚信号以缩短内部推理步骤
50%待验证Swift的优化发生在推理行为层面,模型参数量不变,这与针对模型权重的蒸馏或量化压缩手段有本质区别
50%待验证在基础版消耗token最多的20次运行对比中,Swift只用了29%的token却解出16题,与基础版的17题几乎持平
50%待验证Swift在任何单个案例上最多用44K token,而基础版最高达到203K token
50%待验证在C++语言测试中Swift的token用量仅为基础版的29%,但6次质量损失中占了3次
50%待验证对于重度C++开发者,Swift激进的推理压缩带来质量波动,建议适当放宽推理预算以求稳
50%待验证配对统计(n=107)显示99例一致、2例Swift更优、6例更差,McNemar精确检验p≈0.29,两者质量统计上难以区分
50%待验证测试使用Swift版Q5_K_L、基础版Unsloth的Q5_K_XL量化配置,均在128GB内存中运行并支持262K上下文,engrams均为Q8_0并存放于SSD
50%待验证Swift的有效diff率达到100%,意味着生成的代码补丁格式完全规范
50%