无需反向传播?0.8B模型在ARC-Challenge上超越2B模型引热议

一个0.8B模型声称无需反向传播即在ARC-Challenge上超越未微调2B模型,但可复现性存疑。
Reddit上有人声称,一个仅0.8B参数的模型在不使用反向传播的情况下,于ARC-Challenge基准测试上取得42.15%的成绩,超越了未微调的Qwen3.5-2B基础模型以及使用2.5万条数据进行SFT蒸馏的方案,训练在NVIDIA L4显卡上完成。这一声明呼应了学界对Forward-Forward算法、进化策略等反向传播替代路线的探索,暗示小模型训练在方法层面仍存在巨大优化空间。然而,由于缺乏完整论文和开源代码,评测的射程配置(0-shot还是few-shot)、对比基准的公平性(已训练模型vs未微调模型)以及结果的可复现性均存疑。文章建议将这一结果视为值得关注的初步信号,而非确定性突破,并呼吁跟踪后续的技术报告或开源实现。
一个挑战常识的声明
反向传播(backpropagation)是现代深度学习训练的基石,几乎所有大语言模型的训练都建立在这套梯度下降的框架之上。但一则来自Reddit的技术分享提出了一个颇具颠覆性的问题:如果我们并不真的需要反向传播,会怎样?
发帖者声称,其训练的一个仅0.8B(8亿)参数的模型,在ARC-Challenge基准测试上取得了42.15%的成绩,不仅超过了未经微调的Qwen3.5-2B基础模型,还显著优于使用2.5万条数据进行SFT(监督微调)蒸馏的方案。整个结果据称在NVIDIA L4显卡上得到了验证。

如果这一结果属实,它触及了当前AI训练范式中几个值得深思的问题:模型规模是否被过度强调?训练方法本身是否还有巨大的优化空间?
ARC-Challenge的分量
要理解这个结果的意义,需要先了解ARC-Challenge这个基准的难度。ARC(AI2 Reasoning Challenge)是艾伦人工智能研究所推出的科学推理问答数据集,Challenge子集专门筛选出那些传统检索方法和简单词共现算法都无法解决的难题,强调真正的推理能力而非记忆匹配。
在这个基准上,参数量通常与表现正相关——更大的模型往往拥有更强的推理能力。因此,一个0.8B模型超越2B级别模型的表述,本身就打破了"规模即性能"的直觉。发帖者特别强调了与"25k SFT蒸馏"方案的对比,这暗示其方法在数据效率上同样具备优势。
为什么对比SFT蒸馏很关键
监督微调蒸馏是当前小模型获得能力的主流手段:用大模型生成的数据去训练小模型,让小模型"模仿"大模型的输出。这种方法需要大量标注或合成数据(如帖中提到的2.5万条)。如果一个替代训练方法能用更少的资源达到更好效果,对于资源受限的研究者和企业而言,吸引力很明显。
ARC数据集于2018年由Allen Institute for AI发布,包含约8000道美国3-9年级的标准化科学考试题目。其中Easy子集可被传统IR系统或词共现模型答对,而Challenge子集则专门挑选出这两类系统均答错的题目,共约1172道测试题。由于题目均为多项选择(四选一随机基线为25%),42.15%的成绩意味着模型具备了超越随机猜测的显著推理能力,但距离当前顶尖的大型模型(如GPT-4级别在该测试上可达90%以上)仍有较大差距。值得注意的是,ARC-Challenge在过去几年里已经逐渐从"难题"向"基础题"迁移——许多主流的7B以上模型已能轻松突破70%,因此42.15%对于0.8B模型而言属于有竞争力但并非突破性的分数区间,这也是理解原帖声明时需要校准的重要背景。
知识蒸馏(Knowledge Distillation)最初由Hinton等人在2015年系统化提出,核心思想是让小模型(学生)学习大模型(教师)输出的软标签(soft labels)或完整的输出分布,而非仅学习硬标签(hard labels)。在大语言模型时代,这一范式演变为"数据蒸馏":用教师模型(如GPT-4或LLaMA-3-70B)批量生成高质量的指令-回答对,再对学生模型进行监督微调。帖中提到的"25k SFT蒸馏"即指使用2.5万条此类合成数据进行微调。这种方法的成本并不低——生成2.5万条高质量数据需要调用大模型API或自行部署大模型,同时反向传播微调本身也需要可观的GPU算力和显存。因此,如果一种方法能在更低的数据和算力投入下超越蒸馏方案,其实用价值将非常显著,尤其对于学术实验室和中小企业。
不用反向传播,还能怎么训练?
帖子标题抛出的核心悬念,是绕开反向传播的训练路径。虽然原始内容并未展开技术细节,但这一方向在学术界并非全新概念。近年来已有多条探索路线试图挑战反向传播的垄断地位:
- 前向-前向算法(Forward-Forward):由Geoffrey Hinton提出,用两次前向传播替代反向传播,分别处理正样本和负样本。
- 进化策略与无梯度优化:通过采样和选择而非梯度来更新参数。
- 局部学习规则:让每一层基于局部信息更新,避免全局梯度回传。
这些方法的共同诉求在于:降低内存占用、支持更灵活的硬件、以及可能更接近生物神经系统的学习机制。在NVIDIA L4这类定位推理、显存相对有限的显卡上完成训练验证,恰恰呼应了无反向传播方法在资源效率上的潜在优势。
反向传播本质上是链式法则的自动化应用:通过计算损失函数对每个参数的偏导数,沿着网络层层回传误差信号,进而用梯度下降更新权重。这一机制高度依赖全局计算图的保存(即激活值的缓存),在训练大模型时会消耗大量显存,通常是推理阶段的3-4倍甚至更多。Geoffrey Hinton在2022年提出的Forward-Forward算法通过引入"好数据"与"坏数据"的对比学习目标,让每一层独立地基于局部目标函数进行参数更新,从根本上消除了梯度回传的需要。这类方法的潜在优势不仅在于显存效率,还在于天然支持层间并行计算和流式训练,理论上更适合边缘设备或异构硬件。然而目前学界的共识是,这些方法在大规模语言模型任务上仍难以匹敌反向传播的收敛效率和最终性能,这也是原帖声明之所以引人注目的背景所在。
保持审慎:声明背后的待验证问题
面对这样一则缺乏完整论文和开源代码支撑的声明,审慎态度是必要的。几个关键问题目前无法从原始内容中得到解答:
评测的严谨性。 42.15%这个数字采用的是0-shot还是few-shot设置?评测脚本是否标准?不同的评测配置可能导致结果差异巨大,直接对比需要统一的实验条件。
对比的公平性。 "stock Qwen3.5-2B"指的是完全未微调的基础模型,而拿一个针对性训练过的0.8B模型去对比未微调的2B模型,比较基准本身就存在不对等。更有说服力的对比应该是同等训练投入下的横向评测。
可复现性。 真正能推动领域进步的,是可被他人独立复现的结果。在代码、权重和完整方法公开之前,42.15%更应被视为一个值得关注的初步信号,而非确定性结论。
对小模型路线的启示
抛开单一数据点的争议,这则分享折射出一个正在升温的趋势:业界对"小而精"模型的兴趣持续增长。在动辄千亿参数的军备竞赛之外,如何用更少的参数、更低的训练成本榨取更强的能力,正成为一条备受关注的平行赛道。
无论反向传播是否真的可以被替代,这类探索的价值在于:它迫使我们重新审视那些被当作"理所当然"的技术假设。如果训练范式本身存在根本性的优化空间,那么当前以算力堆砌为核心的发展路径,或许并非唯一答案。
对于关注这一方向的读者,建议持续跟踪该项目后续是否会放出技术报告或开源实现。只有当方法透明、结果可复现时,这个0.8B模型的成绩才能从"引人注目的声明"转变为"可信赖的突破"。
相关推荐

Mistral Large 4(LeChonk)发布:欧洲从零打造的万亿参数开源模型
Mistral 发布万亿参数开源模型 Mistral Large 4(LeChonk),完全在欧洲从零训练。本文解析其 MoE 架构、定价、网络安全跑分表现,以及开源模型即插即用难题与真实价值。

RISED:多环境智能体训练的评分标准选择与自蒸馏方法
RISED 提出面向多环境智能体训练的评分标准选择与自蒸馏方法,解决跨环境样本精细筛选难题,以及批次内全失败/全成功组导致的组相对奖励信号失效问题,提升通用型 LLM 智能体的训练效率。

GPT-6.1 Sol「泄露」疑云:循环与嵌套模型架构浮出水面
一篇 Reddit 热帖通过推理速度数据反推 GPT-6/6.1 Sol、Astra、Luna 的底层架构,提出循环 Transformer 与嵌套模型可能同时被用于大规模低成本部署。本文梳理其推演逻辑与对开源社区的启示。