[控场AI]
· 5 分钟阅读· 2,948 字

LessThink-Qwen3-4B:把推理Token砍掉44%

LessThink-Qwen3-4B:把推理Token砍掉44%

开发者对Qwen3-4B后训练,推理token减少44%,单卡完成,但关键数据尚待独立验证

一位开发者在不更换模型底座的前提下,通过后训练手段让Qwen3-4B的推理阶段token消耗减少约44%,并声称保留了原有的知识储备与回答风格,整条流水线仅用一张GPU完成。这一工作触及了推理模型当前最现实的成本痛点:以o1、R1、Qwen3为代表的思维链模型在输出答案前会产生大量"内心独白"式推理token,直接推高延迟与账单。LessThink的路径有别于换小底座或强制截断思考的常规做法,追求"能力不变、思考更紧凑"的第三条路。然而44%这一数字的测量口径、评测方法与数据构造均未公开,目前也仅有作者单一来源,缺乏独立复现,其真实效果需审慎对待。该工作的更大意义在于提示了一个被忽视的调优维度:思考效率本身是可以像准确率一样被系统优化的指标。

推理模型越来越贵的不是参数量,而是它开口之前的那段自言自语。Reddit 上一位开发者放出了 LessThink-Qwen3-4B——他没有换底座、没有加参数,而是对 Qwen3-4B 做了一次后训练(post-training),让同一个模型在推理阶段少花 44% 的 token,同时尽量保住原来的知识面和回答风格。

值得一提的是,整条流水线只跑在一张 GPU 上。

reddit source: LessThink-Qwen3-4B: the same model, with far less thinking [P]

"想太久"已经成了推理模型的默认病

自从 o1、R1、Qwen3 这类模型把"思维链"摆到台面上,行业默认了一个朴素信仰:想得越久,答得越准。于是大量产品把思考预算拉满,用一个几百 token 就能解决的问题去烧几千 token 的过程。

这笔账在演示视频里看不见,在账单上非常刺眼。推理 token 直接决定延迟和成本:用户等的是第一个字出来之前的沉默,企业付的是每百万 token 的单价。当模型把"3+5=?"也写成一段内心独白时,浪费的不只是算力,还有用户耐心。

更麻烦的是,长思考并不总是带来正确答案。在简单事实问答、格式转换、代码补全这类任务上,过长的推理链反而增加跑偏和重复的概率。这类现象在社区里有个通俗说法——"过度思考"。

思维链(Chain-of-Thought,CoT)推理最初由 Google Brain 的研究者在 2022 年提出,核心思想是让模型在给出最终答案前先输出中间推理步骤,从而在数学、逻辑等复杂任务上显著提升准确率。o1、DeepSeek广告-R1、Qwen3 等模型将这一机制发扬光大,引入了"扩展思考时间"(extended thinking)的训练范式——模型被鼓励在 <think> 标签内产出大量内心独白式的推理过程,再给出最终回答。这种机制的代价是 token 消耗呈数量级上升:一个原本输出 200 token 答案的请求,可能附带 2000-8000 token 的思考过程。对于按 token 计费的 API 服务(如 OpenAI、Anthropic、阿里云广告百炼等),这意味着同等问题的调用成本可能是普通模型的 5-20 倍,延迟也同步拉长,因为用户需要等待模型"想完"才能看到第一个输出字符。

LessThink-Qwen3-4B 到底改了什么

目标不是变聪明,而是变利索

按照作者的说法,这次后训练有两项硬约束:

  • 推理 token 减少约 44%:即模型在给出最终答案前输出的思考内容显著缩短;
  • 知识与回答风格基本不变:作者强调保留原模型的知识储备和作答口吻,而不是把模型"训笨"换取速度。

这个约束组合很关键。市面上降低推理成本的主流做法有两类:一是换更小的底座,二是把思考过程直接截断或关闭。前者丢能力,后者丢稳定性——一刀切掉思考的模型往往在稍有难度的问题上直接崩。LessThink 想走的是第三条路:能力不变,思考更紧凑。

单卡跑完全流程

作者特别提到整条流水线只用了一张 GPU。放在动辄几十上百卡的微调叙事里,这句话的分量不小:它意味着小模型的"行为矫正"已经进入个人开发者可以独立完成的区间。

要注意的是,原始素材并未披露具体的数据构造方式、训练算法、采样规模,也没有给出基准测试明细。因此 44% 这个数字应当理解为作者自述的口径,而不是经过第三方复现的结论。

后训练(post-training)是指在预训练完成后,针对特定行为目标对模型进行进一步调整的统称,常见手段包括监督微调(SFT)、基于人类反馈的强化学习(RLHF)以及近期流行的基于规则奖励的强化学习(如 GRPO、PPO with verifiable rewards)。对于"压缩思考长度"这一具体目标,通常的做法是构造"短思考-正确答案"配对数据进行 SFT,或设计长度惩罚奖励函数进行强化学习训练——奖励信号同时考量答案正确性与思考 token 数量,引导模型在保证准确的前提下自发缩短推理链。由于 Qwen3-4B 本身仅有约 40 亿参数,完整权重占用显存约 8-16GB(取决于量化精度),在消费级 GPU(如 RTX 4090 的 24GB 显存)上可以容纳完整的微调过程,这正是作者"单卡完成"说法的硬件基础。

为什么"少想"是一条值得走的路

把推理长度当成可调参数而不是荣誉勋章,背后是三个现实压力:

成本与延迟。 推理 token 是推理服务的主要成本项。对于日调用量以亿计的对话产品,44% 的思考量削减在账单上是非常直观的数字,对于端侧或低配部署更是生死线。

小模型的性价比。 4B 级别的模型本来就以"够用、便宜、能塞进消费级显卡"为卖点。如果这类模型能进一步压缩思考开销,它就能覆盖更多边缘场景——本地助手、批量文档处理、代码内联补全。

思考长度的可控性。 与其在部署时用系统提示词求模型"请简短回答",不如把这种偏好直接训进权重。前者不稳定,后者是默认行为。LessThink 的思路正是把"少说废话"从外部约束变成模型的内在习惯。

几个需要打问号的地方

理性的读者应该对这类个人发布保持几点审慎:

  • 44% 的测量口径不明。 是平均思考 token 数,还是中位数?在哪类任务上测的?难任务的思考量有没有被压缩到影响正确率?
  • "知识不变"如何验证。 后训练很容易在压缩思考的同时削弱长尾知识。没有公开的评测对比,这个承诺只能先记下。
  • 模型的"风格"能否量化。 回答风格是主观感受,缺少可复现的评测指标。
  • 单一来源。 目前只有作者本人的说明和一个项目页面,尚无独立复现或第三方评测。

这些不是否定性判断,而是任何未经同行验证的工作都应承受的正常审视。

在大模型能力评估领域,"知识保留"通常通过标准基准测试来量化,常用的包括 MMLU(大规模多任务语言理解)、GSM8K(小学数学推理)、HumanEval(代码生成)等。后训练导致的"遗忘"(catastrophic forgetting)是一个已知风险:模型在向特定行为偏移时,可能削弱与训练目标无直接关联的长尾知识。独立第三方复现的意义在于,使用统一的评测口径跑这些基准,才能判断 44% 的 token 节省究竟是"去掉了冗余废话"还是"跳过了必要推理步骤"。目前学术界和工程社区对推理效率的评估尚无标准化框架,这也是此类个人发布工作难以快速获得信任的结构性原因。

对开发者意味着什么

LessThink-Qwen3-4B 更像一个方向性的示范,而非一个立等可用的成品:证明了对已有的推理模型做定向后训练、压缩其思考开销,在单卡条件下是可行的。

对做推理服务的人来说,可以从中提炼出两个可操作的问题:自己业务里有多少推理 token 花在了没有信息增益的思考上?这些思考是否可以用更短的表达承载?对小模型团队来说,这类工作提示了一个被忽略的调优维度——除了追准确率,思考效率本身也是一个可以优化的指标。

接下来决定它价值的,是谁来做独立复现,以及 44% 这个数字在真实负载下是否站得住。

分享:

相关推荐