李飞飞谈AI:视觉智能、创造力边界与人类主体性

在Huberman Lab播客的一期深度对话中,斯坦福大学教授、被誉为"AI教母"的李飞飞(Fei-Fei Li)与神经科学家Andrew Huberman展开了一场跨越视觉科学、AI技术演进与人类未来的对话。作为斯坦福以人为本人工智能研究院(HAI)的主任,李飞飞既是现代AI的奠基者之一,也是坚持将伦理与善用置于技术核心的倡导者。HAI由李飞飞和前斯坦福教务长John Etchemendy于2019年共同创立,汇集了来自计算机科学、哲学、政治学、医学、教育学等多个学科的200多位教师,代表了一种不同于纯商业驱动的AI发展路径——强调治理、公平性和多利益相关方参与。这场对话不仅厘清了AI的能力边界,更提出了一个关键命题:AI应当增强而非取代人类。

视觉:智能的基石
李飞飞将视觉视为智能的两条平行发展线索的交汇点。从进化角度看,5.4亿年前海洋动物"看见第一缕光",这一感知能力的出现直接引发了寒武纪生命大爆发。寒武纪大爆发是地球生命史上最重要的事件之一,在短短数千万年内,几乎所有现代动物门类突然出现在化石记录中。牛津大学动物学家Andrew Parker提出的"光开关假说"(Light Switch Theory)认为,正是眼睛的进化触发了这场生物多样性的爆炸——当第一批动物获得视觉能力后,捕食者与猎物之间的军备竞赛急剧升级,推动了硬壳、运动能力、伪装等复杂特征的快速演化。感知外部世界改变了动物的自我认知与生存策略——你能看到食物,也可能成为他人的食物。据她估计,人类大脑约有一半的皮层活动与视觉功能相关,儿童在学会说话之前先学会"看"。
从AI技术线索看,视觉同样扮演了关键角色。上世纪50年代,Hubel和Wiesel在哺乳动物大脑中记录到视觉细胞的层级结构,这一发现启发了神经网络算法的设计。David Hubel和Torsten Wiesel是哈佛大学的神经生理学家,他们通过向猫和猴子的初级视觉皮层(V1区)插入微电极,发现了视觉处理的层级结构:"简单细胞"对特定方向的边缘做出反应,而"复杂细胞"则对移动的边缘反应而不依赖精确位置。这种从简单特征到复杂特征的层级处理思想,直接启发了1980年代Yann LeCun等人开发的卷积神经网络(CNN)架构,二人因此获得1981年诺贝尔生理学或医学奖。虽然今天运行在千亿乃至万亿参数上的神经网络已远超当年记录的生物视觉通路,但其源头与神经科学紧密相连。
ImageNet:现代AI的引爆点
李飞飞回顾了她标志性的工作——ImageNet。2006年作为普林斯顿的青年教师,她注意到当时算法学习的数据量太少,于是转向认知神经科学文献研究人类的视觉学习能力。研究发现,人类到六岁时已能识别数万个物体类别。受此启发,她的团队构建了包含1500万张图像的ImageNet数据集。该项目最终覆盖超过2万个类别,这些类别基于WordNet的层级语义结构组织,标注工作借助了亚马逊Mechanical Turk众包平台,动员了来自167个国家的近5万名标注者。
2012年,神经网络算法、ImageNet数据集与GPU计算这"三要素"的融合,成为现代AI的定义性时刻。GPU(图形处理单元)最初为游戏和图形渲染设计,其架构包含数千个小型计算核心,天然适合神经网络训练中大量并行的矩阵运算。2007年NVIDIA发布CUDA编程框架后,研究者开始将GPU用于通用计算。2012年Alex Krizhevsky团队使用深度卷积神经网络AlexNet,在两块NVIDIA GTX 580 GPU上将ImageNet挑战赛的错误率从26%骤降至16%,训练时间从CPU上的数周缩短至数天,这一突破被广泛认为是深度学习革命的起点。她特别澄清了一个数据:在识别一千类物体的挑战中,人类的错误率约为4%,而机器直到2015年前后才真正超越人类表现。
AI的能力与局限:模式识别的边界

对话中最富哲学深度的部分,在于探讨AI与人脑的根本差异。李飞飞坦率承认:今天的AI本质上是基于海量数据的模式识别与合成。当AI看到"书架后露出的猫尾巴"能判断是猫,是因为它"下载"了互联网上无数猫的图像;而一个孩子可能只见过三到十只猫,却能通过完全不同的学习路径完成同样的判断。
"这正是我们作为神经科学家与AI分道扬镳之处,"李飞飞强调,"这些机制我们尚未完全破解。"这一观察呼应了认知科学中"少样本学习"(few-shot learning)的研究——人类儿童似乎具备强大的归纳偏置(inductive bias),能从极少的样本中抽取本质特征并泛化到新情境,这种能力可能依赖于进化赋予的先天认知结构,而非纯粹的统计学习。
互联网的本质与AI的认知盲区
李飞飞对"互联网"做了精彩的定义:它不是随机的集合,而是"人类行为在多模态形式下最庞大的记录"——文字、图像、视频、声音。AI之所以强大,正因为它训练于这个巨大的人类知识库。
但她指出了AI无法触及的领域:那些从未被捕捉、从未上传到互联网的高度个性化的人类认知。当毕加索产生某个深刻的创作念头时,那个念头究竟来自哪个脑区?我们并不知道。"那个念头如此个性化、如此特殊,它没有被捕捉,因此不在互联网上,AI也从未见过它。这正是人类依然独特的地方。"
她以AlphaGo著名的"第37手"为例说明AI的创造力。2016年3月,DeepMind的AlphaGo在与韩国围棋冠军李世石的第二局比赛中,下出了这步被认为概率极低(策略网络评估人类选择此手的概率仅为万分之一)但战略价值深远的棋。李飞飞指出,这是一种特殊的创造力,源于围棋清晰的数学规则和AI超强的记忆与计算能力——本质上是对规则空间的穷举搜索与价值评估,但不应与人类那种源于跨领域联想、情感驱动和无意识加工的创造力混为一谈。
医疗与科学发现:AI最激动人心的应用场景
李飞飞认为科学发现是AI最令人兴奋的用途之一。长期以来,科学发现依赖聪明的人类大脑保留有限的知识,并以"肌肉的速度"工作。而AI能够跨学科综合海量信息,这是人脑难以做到的。
Huberman分享了一个亲身案例:几个月前,AI帮他区分了眩晕与低血压——而一位研究前庭系统的耳鼻喉专家却判断错误。事实证明是一种降压药导致的轻微不良反应。这类在数据库中被反复记录的药物相互作用和副作用问题,AI能通过快速检索和模式匹配为缺乏即时就医渠道的人提供帮助,尤其在基层医疗资源匮乏的地区,AI有望成为重要的辅助诊断工具。
人机协作胜过单打独斗
李飞飞的父亲近期在斯坦福接受了达芬奇机器人辅助的肝脏手术,出血量比传统手术少了十倍。达芬奇手术系统(Da Vinci Surgical System)由Intuitive Surgical公司开发,自2000年获FDA批准以来已在全球完成超过1200万例手术。它并非自主机器人,而是遥操作系统:外科医生坐在控制台前,通过3D高清视觉和精密机械臂执行微创手术,系统将医生的手部动作缩小并过滤掉生理性震颤,使操作精度达到亚毫米级。
但她通过与外科医生的深入交流揭示了一个重要事实:肝脏血管极其复杂且个体差异大,即便汇集全球所有肝脏手术数据,也未必足以训练出能自主完成手术的AI。
"当模式不够丰富时,我们必须知道如何使用或不使用AI,"她总结道。在这种情况下,人类与机器人协作远胜于"学艺不精"的机器人独立操作。这体现了人机协作的核心原则:AI在数据丰富、规则明确的领域表现卓越,但在高度个性化、数据稀缺的场景中,人类专家的判断力和适应能力仍不可替代。
主体性:AI时代的核心议题

贯穿整场对话的关键词是"主体性"(agency)。在哲学和认知科学中,主体性指的是个体自主行动、做出选择并对世界施加影响的能力。李飞飞反复强调,AI应被视为增强人类主体性的工具,而非剥夺它。"引领当今AI的人不应该那样说话,好像这项工作会剥夺人们的主体性。"
她对语言的误用发出警告:AI并没有情感。当机器说"很遗憾你今天生病了",那只是它从数据中学到的模式——大语言模型通过预测下一个token来生成看似有情感的回应,但其底层是统计概率而非主观体验;而你的朋友说同样的话,是因为他们真心希望你康复。"我们必须区分这一点,不能让公众感到困惑。"这一观点也呼应了哲学家John Searle的"中文房间"思想实验:系统可以产生看似理解的输出,但这并不意味着它真正"理解"了什么。
对年轻一代的期望与担忧
作为教育者,李飞飞对年轻一代抱有希望。她批评了"老一代总是哀叹下一代"的倾向,认为纵观人类历史,我们大体上在向好发展。
但她提出了两种危险:一是AI使用不当,导致年轻人的学习主体性与动机被工具剥夺——沉迷刷短视频、被动观看;二是以保护主体性为名,因担心作弊而剥夺学生使用工具的机会。她回忆自己当年学有机化学的痛苦,如果当时有AI伴学,能随时解答疑问,学习效率将大幅提升。
李飞飞特别呼吁社会关注被遗忘的群体——教师、家长和学生。2022年11月ChatGPT问世时,作为内行的她做的第一件事,是主动联系孩子所在小学的校长,提出为师生做客座讲座。"没有投资者、没有万亿美元的公司会想到:我们社区里的老师怎么办?但我们需要与教师对话,赋能他们。"
空间智能:AI的下一个前沿方向
李飞飞的创业公司World Labs代表了她认为超越语言智能的"下一章"——空间与物理智能。空间智能是指理解和推理三维物理世界的能力,包括物体的形状、位置、运动、物理属性及其交互关系。在认知科学中,这与Jean Piaget提出的"感知运动阶段"(0-2岁)密切相关:婴儿在学会语言之前,先通过与物理世界的互动建立空间认知模型。人类在语言之前先发展出前语言能力,进化用了5亿年才形成语言沟通。
World Labs成立于2024年,致力于构建"大世界模型"(Large World Models),能够生成和理解3D/4D环境,服务于内容创作者、机器人训练、建筑设计等领域。这超越了当前大语言模型仅处理文本和2D图像的局限,指向具身智能(Embodied AI)和物理世界理解的下一个技术前沿。它不仅捕捉真实世界的图像,更允许人们将"心眼中想象的世界"通过一句话、一张图或草图变为可交互的环境。
对于AI在电影制作等创意领域的应用,李飞飞态度审慎。她强调技术已足够先进,能将剧本生成视频镜头,但故事创作中深刻的人性——情感、技巧、看待世界的独特方式——才是核心。"技术应该让创作者的工作更好,为他们的创造力赋能,而不是取代他们的工作。"
结语:在技术狂热中保持清醒
李飞飞的立场清晰而温和:既反对制造恐慌的"末日论",也反对认为技术永远正确的"乌托邦论"。"我们应该回到中间地带,谈论这项技术是什么、如何使用它、我们如何集体拥有引导未来的主体性。"这或许正是这个"文明时刻"最需要的声音——在技术加速发展的当下,我们需要的不仅是更强大的模型,更是理解何时使用、何时克制的集体智慧。
相关推荐

无状态数据库:AI智能体记忆的轻量化方案详解
深入解析无状态智能体记忆数据库的设计原理与工程价值,探讨轻量化方案如何解决AI Agent记忆管理痛点,涵盖无状态架构优势、向量检索替代方案及实际落地挑战。

零框架实现RAG与Agent:AI工程师必备的底层能力
深入解析AI Engineer Notebooks开源项目,通过零框架方式从底层代码实现RAG检索增强生成、Agent智能体和Evals评估体系,帮助开发者摆脱框架黑盒,真正理解AI工程核心原理。支持Google Colab免费运行。

Gemini Omni 1.1 Flash深度解读:全模态+极速推理如何改变AI落地
深度解读谷歌Gemini Omni 1.1 Flash模型的全模态能力与极速推理特性,分析其产品定位、开发者应用场景、与GPT和Claude的竞品对比,以及对AI规模化落地的实际意义。