[控场AI]
· 5 分钟阅读· 2,516 字

编程能让人更聪明吗?从认知迁移研究看AI的能力边界

编程能让人更聪明吗?从认知迁移研究看AI的能力边界

80年代心理学研究证明领域训练不产生通用能力迁移,这一结论为审视AI的通用智能主张提供了重要参照。

文章回顾了上世纪80年代一项被广泛忽视的心理学发现:学习编程或数学等领域,并不会提升大脑的通用推理能力,专项技能的进步无法「迁移」到无关领域。核心结论是,通用智能更像大脑的底层基础属性,而非可通过训练堆砌的技能集合。文章随后将这一人类认知研究结论引入AI讨论,提出一个关键质疑:当AI模型在特定任务上刷出高分,这究竟意味着通用智能的涌现,还是仅仅是垂直专项能力的叠加?作者呈现了两种解读方向——要么通用智能需要架构层面的根本突破,要么人类认知与机器学习的迁移机制根本不可类比——并提醒读者警惕将高基准分数等同于通用智能的常见误区。

一个被遗忘的心理学结论

上世纪80年代,心理学界曾掀起一股研究热潮,主题是「编程的认知后果」(cognitive consequences of programming)。当时流行的假设颇具吸引力:学习形式逻辑和算法结构,就像给大脑做体操,能够全面提升推理、规划和解决新问题的通用能力。换句话说,学会写代码会让你整体变得更聪明。

这个假设在直觉上非常诱人——毕竟编程要求严密的逻辑、抽象的建模和结构化的思维,这些看起来都是「高级认知」的标志。然而,奠基性研究以及随后的多项元分析(meta-analyses)给出了一个令人意外的结论:这种能力迁移并没有发生。

编程认知后果研究

学习编程的学生确实会变得非常擅长算法思维和编码本身,但这些收益并不会迁移到通用认知任务或与编程无关的问题解决场景中。类似地,密集的数学训练能提升数学推演和结构映射能力,却无法提高一个人在不相关领域中获取新技能的基础速率。

这一研究传统的奠基性工作来自认知心理学家理查德·尼斯比特(Richard Nisbett)等人,以及更早期的迁移学习(transfer learning)研究脉络。心理学中的「迁移」指在一个情境中习得的技能或知识,能在不同情境中被应用的程度。研究者通常将其分为「近迁移」(near transfer,任务高度相似)和「远迁移」(far transfer,任务差异较大)。大量实验表明,近迁移相对容易发生,而远迁移——即跨越领域边界的能力扩展——极为罕见且难以稳定复现。80年代的编程认知研究正是试图证明编程训练能带来远迁移效应,而元分析的否定结论打击的正是这一更宏大的主张。这一领域的研究至今仍有争议,部分后续研究在特定条件下观察到有限的迁移效应,但「编程使人整体更聪明」这一强版本假设已被学界基本放弃。

领域能力 ≠ 通用智能

这一研究发现的核心启示是:通用智能更像是大脑的一种基础属性,而非一项可以通过训练获得的技能。在某个领域反复练习,会让你在该领域越来越强,但不会让你「整体上更聪明」。

这个区分极其重要。它把两件常被混淆的事情分开了:

  • 领域专长(domain expertise):通过刻意练习可以持续积累,比如编程、数学、国际象棋。
  • 通用推理能力(general intelligence):相对稳定,难以通过单一领域的训练显著撬动。

一个精通算法的程序员未必能在陌生领域更快上手,一个数学高手也未必在社交判断或创意写作上占优。练习带来的是垂直深度,而不是水平广度。

这里涉及心理学中一个经典的理论框架:卡特尔-霍恩-卡罗尔(CHC)智力理论对「流体智力」(fluid intelligence)与「晶体智力」(crystallized intelligence)的区分。流体智力指面对全新问题时的推理与适应能力,被认为与遗传和神经基础关系更密切,且在成年后相对稳定甚至随年龄下降;晶体智力则指通过学习和经验积累的知识与技能,可以持续增长。领域专长的积累本质上是晶体智力的扩展,而「通用推理能力」更接近流体智力的范畴。训练某一具体技能,主要发展的是晶体智力,却难以显著提升流体智力,这在神经机制层面提供了一种解释:为何刻意练习能让人在特定领域精进,却无法带来跨领域的普遍智能提升。

这对理解AI意味着什么

原始讨论之所以引用这段人类心理学研究,是因为它为理解当下的AI系统提供了一个「有趣的对照点」。

当我们训练一个模型在特定任务上达到超人表现时,一个自然的疑问是:这种专项能力会不会「外溢」成某种更通用的智能?人类认知迁移研究的历史经验提示我们保持谨慎——在人类身上,领域训练并不自动转化为通用能力的提升。

这引出了AI领域一个长期的核心争论:模型在海量数据上习得的强大领域能力,究竟是在逼近某种通用智能,还是仅仅是在各个垂直领域不断堆叠「专项技能」?如果连人类大脑这样高度灵活的系统都难以实现跨域迁移,那么关于AI「涌现通用能力」的说法,是否也需要更严格的审视?

两种可能的解读

这段类比可以被朝两个方向解读,值得如实呈现:

一种观点认为,这恰恰说明通用智能是独立于具体技能的「底层架构」,不是靠在某个任务上刷分能堆出来的——对AI而言,这意味着真正的通用性可能需要架构层面的突破,而非单纯的能力叠加。

另一种观点则会质疑这个类比的适用性:人类的认知迁移机制与机器学习的泛化机制并不相同,用80年代的编程心理学结论直接套用到现代大模型上,可能存在过度简化的风险。

AI领域对应的核心概念是「泛化」(generalization)与「分布外推理」(out-of-distribution reasoning)。一个模型在训练分布内表现出色,并不保证它能处理训练时从未遇到的新型问题——这与人类的「远迁移」困境在结构上颇为相似。当前大型语言模型展现出的「涌现能力」(emergent capabilities)被部分研究者视为通用智能的信号,但也有研究者指出,这些能力可能仍是对训练数据中隐含模式的高效压缩与检索,而非真正意义上的跨域推理。评估AI是否具备通用能力的标准测试(如ARC-AGI基准)正是为了区分「在见过的任务上表现好」与「能灵活应对全新结构性问题」这两种本质不同的能力,其设计思路与心理学中区分近迁移和远迁移的逻辑一脉相承。

练习的真正价值

无论用于解释人还是AI,这项研究都没有否定练习的意义。它否定的只是一个过于乐观的幻想——即某一类训练能像万能钥匙一样打开所有认知门锁。

对个人成长而言,这意味着如果你想在某个领域变强,就得在那个领域直接下功夫,指望通过学编程来「顺便」提升一切是不现实的。对AI研究而言,它提醒我们区分「做得好」和「变聪明」是两回事:一个在基准测试上刷出高分的系统,不等于拥有了可以自由迁移的通用智能。

智能的本质,或许远比「多练习就会更聪明」这个朴素假设要复杂得多。

分享:

相关推荐