[控场AI]
· 16 分钟阅读· 8,301 字

AI辅助作业提分18%,考试却暴跌20%:虚假高效的代价

AI辅助作业提分18%,考试却暴跌20%:虚假高效的代价

一个反直觉的研究发现

人工智能正在渗透进教育的每一个角落。从写作业到备考,学生们越来越依赖ChatGPT等大语言模型来完成学习任务。这些大语言模型(Large Language Models, LLMs)基于Transformer架构,通过海量文本数据训练而成,能够生成连贯、逻辑性强的文本输出。Transformer架构是2017年由Google研究团队在论文《Attention Is All You Need》中提出的革命性深度学习架构,其核心创新是自注意力机制(Self-Attention),允许模型在处理序列数据时同时关注输入的所有位置,而非像此前的循环神经网络(RNN)那样逐步处理。这一突破使得模型能够捕捉长距离依赖关系,并支持大规模并行计算,从而使训练数十亿甚至万亿参数的模型成为可能。GPT系列(Generative Pre-trained Transformer)采用的是仅解码器(Decoder-only)架构,通过自回归方式逐token生成文本,其「涌现能力」——即在模型规模超过某一阈值后突然展现出的复杂推理能力——是其在教育场景中表现惊人的根本原因。

自2022年底ChatGPT发布以来,其在教育场景中的渗透速度远超预期——斯坦福大学2024年的调查显示,超过60%的大学生承认在学业中使用过生成式AI工具。值得注意的是,OpenAI的GPT系列模型经历了一条快速演进的路径:2018年的GPT-1仅有1.17亿参数,到2020年的GPT-3已达到1750亿参数,而2023年的GPT-4则被广泛推测采用了混合专家(Mixture of Experts, MoE)架构,规模进一步跃升。每一代模型在推理能力、指令遵循和知识广度上的质变,使其教育应用场景也随之急剧扩展。与此同时,教育AI的生态已远不止ChatGPT一家——Anthropic的Claude以长文本理解和安全性见长,Google的Gemini深度整合了搜索能力,Perplexity则专注于带引用的学术检索。更具针对性的是专用教育AI平台的兴起:可汗学院与OpenAI合作推出的Khanmigo内置了教学法约束,Duolingo Max利用GPT-4提供沉浸式语言对话练习。这种多层次的工具生态意味着AI对教育的影响不是单一维度的,不同工具的设计理念直接决定了它们是促进还是削弱学习。

教育机构对此的应对也经历了戏剧性的转变。2023年初,纽约市教育局率先在学校网络中封禁ChatGPT,澳大利亚多州和法国部分学校迅速跟进。然而,仅仅数月之后,许多机构就意识到全面禁止既不可行也不明智——纽约市教育局在2023年5月撤回禁令,转而鼓励教师探索AI的教学整合。这种从恐慌到务实的政策摆动,反映出一个根本性的认识:AI已经不可逆地嵌入了学生的学习环境,关键问题不是「是否使用」,而是「如何使用」。

这些工具不仅能回答问题,还能生成论文大纲、解题步骤、代码片段,甚至模拟特定学科的专家对话,使得传统的作业评估方式面临前所未有的挑战。

然而,一项研究却揭示了一个令人警醒的现象:AI在短期内确实能提升作业成绩,但从长期来看,它可能正在悄悄侵蚀学生真正的学习能力。

研究显示,使用AI辅助的学生作业分数提高了18%,这看起来是个不错的成果。但当同样的学生进入不能使用AI的闭卷考试环节时,他们的考试成绩却下降了20%。这一升一降之间的巨大反差,正是这项研究引发广泛讨论的核心所在。这类研究通常采用随机对照实验(Randomized Controlled Trial, RCT)设计——被认为是因果推断的「黄金标准」——将学生随机分配到AI辅助组和对照组,在控制先验知识水平、学科领域、任务难度等混淆变量后,比较两组在即时表现(作业)和延迟表现(考试)上的差异。值得注意的是,这一发现并非孤例:2024年发表在《Nature Human Behaviour》上的多项相关研究也观察到了类似的「表现-学习解耦」现象,其中宾夕法尼亚大学的一项大规模研究涵盖了超过1000名学生的数据,结果高度一致地表明AI辅助与独立考试表现之间存在负相关。

「成绩幻觉」:作业分数为何具有欺骗性

作业分数的提升很容易被误读为学习效果的改善。但仔细分析这组数据,我们会发现问题的本质:作业分数衡量的是「任务完成质量」,而考试分数衡量的是「知识内化程度」。这两者之间存在着关键性的差异。

当学生借助AI完成作业时,AI承担了大部分认知负荷——它帮助理解题目、组织答案、检查错误。学生看似在「做作业」,实际上更多是在「审阅AI的输出」。这个过程绕过了真正的学习环节:主动思考、试错、以及从困惑到理解的艰难跨越。

认知负荷的转移如何影响学习效果

心理学中有一个重要概念叫「有效认知负荷」(Germane Cognitive Load),指的是那些真正促进长期记忆和技能形成的心理努力。这一概念来源于认知负荷理论(Cognitive Load Theory),由澳大利亚教育心理学家John Sweller于1988年提出,是教学设计领域最具影响力的理论框架之一。该理论将学习过程中的认知负荷分为三类:内在认知负荷(Intrinsic)由学习材料本身的复杂度决定;外在认知负荷(Extraneous)由不良的教学设计产生,应尽量消除;有效认知负荷(Germane)则是学习者将信息整合进长期记忆图式(Schema)时所付出的心理努力。有效认知负荷是学习真正发生的核心机制——它驱动着知识的编码、组织和存储过程。

从神经科学的角度来看,这一理论有着坚实的生物学基础。工作记忆(Working Memory)的容量限制——通常被描述为7±2个信息组块(Miller, 1956),后来Cowan(2001)修正为约4个组块——是该理论的生物学约束条件。要更精确地理解这一约束,有必要了解现代认知心理学对工作记忆的建模。英国心理学家Alan Baddeley在1974年提出并持续修订的工作记忆模型将其分解为多个协作子系统:中央执行系统(Central Executive)负责注意力分配和任务切换,是整个系统的「指挥官」;语音回路(Phonological Loop)处理和暂存语言信息,解释了为什么我们在学习时常常「默念」——这实际上是一种维持性复述策略;视空间画板(Visuospatial Sketchpad)处理图像和空间信息,在几何学习或地图阅读等任务中至关重要;2000年新增的情景缓冲区(Episodic Buffer)则整合来自不同子系统和长期记忆的信息,形成连贯的多模态表征。当学生主动解题时,这些子系统全部被调动——语音回路处理题目文字,视空间画板构建心理模型,中央执行系统协调推理步骤,情景缓冲区将新信息与已有知识整合。但当AI生成了完整答案,学生仅仅阅读时,这一精密的协作过程被大幅简化,尤其是中央执行系统的深度参与被绕过了。

当学习者主动进行认知加工时,前额叶皮层(Prefrontal Cortex)和海马体(Hippocampus)之间的神经通路被激活,促进信息从工作记忆向长期记忆的转化。这个转化过程需要重复的神经激活模式,即所谓的「长时程增强」(Long-Term Potentiation, LTP)——突触连接在反复激活后变得更强、传递效率更高。AI代劳认知加工的问题在于,它绕过了这些神经通路的激活,使得相关突触连接无法得到强化,知识因此无法真正「写入」长期记忆。值得补充的是,记忆巩固(Memory Consolidation)不仅发生在清醒时的学习过程中,也关键性地发生在睡眠期间。神经科学研究表明,白天学习时形成的海马体记忆痕迹在深度睡眠(慢波睡眠)期间被「重播」(Replay),逐步转移到新皮层中形成更稳定的长期记忆。这意味着学习的效果不仅取决于学习当下的认知投入,还取决于此后的巩固过程。如果学习时的认知参与度不足——如仅仅浏览AI生成的答案——形成的记忆痕迹本身就很微弱,即使经过睡眠巩固也难以形成持久记忆。

学习本质上是一个需要「费力」的过程——正是这种适度的挣扎,才让知识在大脑中扎根。当AI替学生消除了这种「费力感」,学习就变成了一种表面的、被动的信息接收。学生获得了正确答案,却没有获得得出答案的能力。当AI代替学生完成认知加工时,被消除的恰恰是这种促进深层学习的有效负荷。这也解释了为什么在有AI辅助时表现优异的学生,一旦失去这个「拐杖」,就会立刻显露出知识掌握的空洞。

「合意困难」理论的现实印证

这项研究实际上为教育心理学中著名的「合意困难」(Desirable Difficulties)理论提供了又一个现实案例。该理论由加州大学洛杉矶分校(UCLA)的认知心理学教授Robert Bjork及其妻子Elizabeth Bjork在1990年代系统提出,核心观点是:那些在学习过程中制造适度困难的条件,虽然会降低即时表现,却能显著提升长期的保持和迁移能力。

该理论源于大量实验证据,包括间隔效应(Spacing Effect)、交错练习(Interleaving)、测试效应(Testing Effect)和生成效应(Generation Effect)等经典发现。间隔效应最早由德国心理学家艾宾浩斯(Hermann Ebbinghaus)在1885年发现,此后超过一个世纪的研究不断验证和扩展这一发现。2006年Cepeda等人对184项研究的元分析表明,间隔练习的优势在延迟测试中尤为显著——间隔复习虽然让每次练习感觉更难,但比集中复习的长期保持率高出50%以上。测试效应(也称提取练习效应)则由Roediger和Karpicke在2006年的经典实验中系统证明:仅仅进行回忆练习(即使回忆失败)也比重复阅读更能促进长期记忆。这些效应的共同机制是:记忆提取本身就是一种学习事件,每次成功或不成功的提取都会修改记忆痕迹的可及性和存储强度。

Bjork将这种现象概括为一个关键区分:学习的「表现」(Performance)与「学习」(Learning)之间存在本质区别——即时表现好不代表真正学到了,即时表现差也不代表没有学习发生。这一区分对理解AI辅助学习的悖论至关重要。

AI辅助恰恰做了相反的事情——它降低了即时的学习困难,让作业变得轻松,但代价是牺牲了长期的学习成果。换句话说,AI让学习变得「太容易」,反而破坏了学习本该发生的过程。

这与我们熟悉的其他学习现象一脉相承:

  • 用荧光笔划重点感觉高效,但主动回忆才真正有效
  • 反复阅读笔记让人感到「熟悉」,但这种熟悉是记忆的假象——心理学称之为「流畅性错觉」(Fluency Illusion),即信息加工的主观容易感被错误地归因为已经掌握
  • AI生成答案让作业「看起来完美」,但大脑并未真正参与

AI辅助学习的正确打开方式

这项研究并不是要全盘否定AI在教育中的价值,而是提醒我们必须重新思考AI的使用方式。问题不在于AI本身,而在于我们如何设计它介入学习的方式。

从「答案工具」转变为「学习伙伴」

如果AI只是被用作快速获取答案的工具,那么它必然会削弱学习效果。但如果引导得当,AI完全可以成为促进深度学习的伙伴。例如:

  • 苏格拉底式提问:让AI通过反问引导学生自己思考,而非直接给出答案。苏格拉底式教学法(Socratic Method)源自古希腊哲学家苏格拉底的对话实践,其核心是通过连续提问引导学习者发现自身认知中的矛盾和漏洞,从而主动建构知识。现代教育研究表明,这种方法能有效激活元认知(Metacognition)——即对自身思维过程的监控和调节能力。元认知包括元认知知识(对自己认知过程的了解)和元认知调节(对学习策略的规划、监控和评估),被广泛认为是区分专家学习者和新手学习者的关键能力。将AI设计为苏格拉底式导师需要在系统提示(System Prompt)层面进行精心设计,例如可汗学院的AI助手Khanmigo就采用了这一策略,当学生提问时,它会先反问「你已经尝试了什么方法?」「你认为下一步应该怎么做?」而非直接给出解答,从而保护了学生的认知参与度。
  • 过程反馈:AI点评学生的思路而非替代思路。这与教育研究中「形成性评估」(Formative Assessment)的理念一致——重点不在于给出最终判断,而在于提供能够指导后续学习的信息反馈。形成性评估这一概念由Michael Scriven在1967年首次提出,后经Black和Wiliam在1998年的里程碑式综述《Inside the Black Box》中系统论证其对学业成就的显著促进作用。他们的研究表明,高质量的形成性反馈——具体的、及时的、关注过程而非仅关注结果的——可以产生相当于0.4到0.7个标准差的学业提升效果,这在教育干预中属于非常大的效应量。AI在这一角色中的潜力是巨大的,因为它可以提供传统课堂中教师因时间和精力限制而无法给予的一对一即时反馈——但前提是反馈的设计必须指向过程而非直接给出答案。
  • 错题分析:AI帮助学生理解错误背后的概念漏洞。这类似于专家辅导中的「诊断性教学」,通过分析错误模式来揭示学生心智模型中的系统性偏差。认知科学研究表明,学生的错误往往不是随机的,而是反映了系统性的「替代概念」(Alternative Conceptions)或「朴素理论」(Naive Theories)。例如,物理学中学生普遍持有的「力与运动方向一致」的错误直觉,或编程学习中对变量赋值的常见误解。AI如果能够识别这些错误模式背后的概念根源,而不仅仅指出「这道题做错了」,就能发挥远超传统纠错的教学价值。

关键在于,AI应该增加「有效认知负荷」,而不是消除它。

教育评估方式的重构

这项研究也对教育评估体系提出了挑战。当作业分数因AI而失真,教育者需要更加重视那些能够真实反映学习成果的评估方式——闭卷考试、口头答辩、实时问题解决等。作业与考试成绩之间的落差,本身就是一个值得关注的诊断信号。

从教育测量学的角度来看,这涉及一个核心概念——效度(Validity)。当AI使得作业成绩不再能准确反映学生的真实能力时,这些评估的构念效度(Construct Validity)就受到了威胁。教育测量学区分了多种效度类型:内容效度(评估是否覆盖了目标知识领域)、标准关联效度(评估结果是否与外部标准一致)、以及构念效度(评估是否真正测量了它声称测量的心理特质)。AI时代的评估设计需要采用多元化的评估手段交叉验证学生的真实学习水平——例如结合过程性数据(学生的修改历史、思考时间分布)、即时口头阐述、以及在受控环境下的表现,形成更完整的学习画像。

值得注意的是,教育评估的范式本身正处于一个历史性的转型期。从20世纪初标准化测试运动的兴起,到1990年代「真实性评估」(Authentic Assessment)理念的推广——强调在真实或模拟真实的情境中评估学生运用知识解决问题的能力——教育评估一直在「标准化效率」与「生态效度」之间寻找平衡。AI的介入使得这一张力更加尖锐。与此同时,许多教育机构开始部署AI检测工具试图识别学生是否使用了AI——Turnitin于2023年推出的AI写作检测功能基于文本困惑度(Perplexity)和突发性(Burstiness)等统计特征来判断文本是否由AI生成,GPTZero等独立工具也采用类似原理。然而,这些工具的误报率和漏报率仍然令人担忧:OpenAI自己的AI文本分类器在2023年因准确率不足而下线,多项独立测试表明现有检测工具对非英语文本、经过改写的AI文本、以及人机混合写作的识别能力极为有限。这意味着,试图通过技术手段「抓住」使用AI的学生是一条难以走通的路——更根本的解决方案在于重新设计评估本身,使其在有或无AI辅助的情况下都能有效测量真正的学习成果。

更深层的警示:短期效率与长期能力的博弈

这个18%对20%的数字对比,其意义远超教育领域。它揭示了人类与AI协作中一个普遍存在的陷阱:短期效率提升可能掩盖长期能力退化。

无论是学生依赖AI写作业,还是程序员依赖AI写代码,抑或是专业人士依赖AI做决策,我们都面临同一个问题:当AI替我们完成了那些「费力」的思考,我们自身的能力是否正在悄然萎缩?这一担忧并非杞人忧天——跨领域的证据已经开始积累。在航空业,过度依赖自动驾驶系统已被证实会削弱飞行员的手动操控能力,美国联邦航空管理局(FAA)多次发布警告要求增加手动飞行训练。在医学领域,研究发现过度依赖诊断辅助系统的医生在系统不可用时,诊断准确率会显著下降。在软件开发领域,频繁使用AI编程助手的开发者在代码审查中发现bug的能力也有所下降。

软件开发领域的证据尤为值得深入考察,因为它是AI辅助工具渗透最快的专业领域之一。GitHub于2022年推出的Copilot(基于OpenAI Codex模型)迅速成为最广泛使用的AI编程助手,GitHub自身2023年的研究声称Copilot可以使开发者完成任务的速度提高55%。然而,这一效率数据的背后存在隐忧。2023年斯坦福大学的一项研究发现,使用AI编程助手的开发者生成的代码中包含安全漏洞的比例显著更高,更关键的是,这些开发者反而更倾向于认为自己的代码是安全的——这是一种元认知层面的偏差。此外,GitClear于2024年初发布的分析报告显示,在Copilot广泛采用之后,开源代码库中「代码搅动」(Code Churn)——即代码在提交后短时间内被修改或撤回的比例——显著增加,暗示AI生成的代码质量存在系统性问题。更深层的担忧是长期技能影响:当初级开发者从一开始就习惯于让AI生成代码框架,他们是否能够发展出从零开始设计系统架构的能力?这个问题目前尚无定论,但趋势值得警惕。

这些案例共同指向一个被称为「自动化悖论」(Automation Paradox)的现象:系统越可靠,人类保持技能的动机越低,但当系统失败时,退化的人类技能使得后果更加严重。这一概念最早由人因工程学家Lisanne Bainbridge在1983年的经典论文《The Ironies of Automation》中系统阐述。她指出了自动化的核心讽刺:设计自动化系统的初衷是消除人类错误,但系统越自动化,留给人类的监控任务就越困难——因为人类需要在长时间无操作后突然接管一个复杂系统。这一框架后来被扩展为「技能退化模型」(Skill Degradation Model),描述了三个阶段:初期的技能保持期(此时人类仍保持警觉和练习)、中期的渐进退化期(技能因缺乏使用而缓慢衰减)、以及后期的突然崩溃期(当系统失效需要人类介入时,退化的技能无法胜任)。在AI辅助学习的语境下,这个模型预示着学生可能在一段时间内维持表面的学业表现,但底层认知技能的退化最终会在高压或无辅助情境中暴露出来。

这项研究给我们的最大启示或许是:AI是一个强大的工具,但工具的价值取决于使用者的智慧。在拥抱AI带来的便利时,我们必须警惕那种以牺牲长期成长为代价的「虚假高效」。真正的进步,从来都需要付出思考的努力。正如认知心理学反复证明的那样:没有捷径的学习,才是通向精通的捷径。

核心要点

  • 成绩幻觉:AI辅助使作业分数提高18%,但闭卷考试成绩下降20%,揭示了「任务完成质量」与「知识内化程度」的本质差异
  • 认知负荷转移:AI消除了促进深层学习的「有效认知负荷」,绕过了工作记忆向长期记忆转化的神经机制
  • 合意困难悖论:学习中的适度困难是特性而非缺陷——降低即时难度会损害长期保持和迁移能力
  • 正确使用方式:AI应从「答案工具」转变为「学习伙伴」,通过苏格拉底式提问和过程反馈增加而非消除认知参与
  • 自动化悖论:跨领域证据表明,对自动化系统的过度依赖会导致人类核心技能的系统性退化
  • 评估重构:AI时代需要多元化评估手段来交叉验证真实学习水平,作业与考试的成绩落差本身就是重要的诊断信号
分享:

相关推荐