别急着嘲笑Gemini:AI模型评价中的认知偏差与进化真相

当我们嘲笑一个AI模型时,我们在嘲笑什么
最近,社区里出现了大量对Gemini新版本的调侃与批评。开发者们习惯性地在社交平台上晒出模型的失误案例,用一种略带优越感的口吻评价它"还差得远"。这种现象在每一个新模型发布时都会周期性上演。
背景知识:Gemini模型系列
Gemini是Google在2023年12月发布的大型语言模型系列,旨在与OpenAI的GPT-4和Anthropic的Claude竞争。该系列包括Ultra、Pro和Nano三个版本,采用多模态架构,能够同时处理文本、图像、音频和视频。与早期多模态模型采用的"拼接式"架构(分别训练视觉编码器和语言模型再通过适配层连接)不同,Gemini从训练阶段就将多种模态数据混合输入,实现了"原生多模态"(natively multimodal)——这意味着模型在理解跨模态关系时更加自然,能够同时理解视频中的画面内容、背景音乐和字幕文字之间的语义关联。这种架构的技术难点在于不同模态数据的tokenization策略和注意力机制的设计,Google利用其在视觉Transformer(ViT)和音频处理(如AudioLM)方面的长期积累来解决这些挑战。
2025年3月,Google发布了Gemini 2.5 Pro版本,进一步提升了推理能力和上下文窗口长度。Gemini的发布标志着Google正式进入生成式AI的核心竞争领域,但每次版本更新都会引发社区的密集测试和评价。这些测试往往采用"红队测试"(Red Teaming)方法——这一概念源自军事和网络安全领域,指专门组建一支团队来扮演"对手"角色,系统性地测试防御体系的弱点。在AI安全领域,红队测试通常包括对抗性提示注入(Prompt Injection)、越狱攻击(Jailbreaking)、事实性错误诱导等多个维度。然而社交媒体上的"民间红队测试"与专业红队测试有本质区别:专业测试关注系统性风险和可复现的漏洞,而社交媒体上的测试往往追求"戏剧性效果"。一个精心构造的极端边界案例被数千次转发,其传播力远超模型在99%常规场景下的稳定表现,这种信息不对称加剧了公众对模型能力的认知偏差,产生显著的"选择性展示偏差"——用户更倾向于分享失败案例而非成功案例。
但一位YouTube创作者提出了一个耐人寻味的反问,值得整个技术社区停下来思考:我们今天嘲笑的这些"不够聪明"的模型,其实早已远远超越了当年被我们奉为里程碑的产品。

ChatGPT 3.5 Turbo:一个被遗忘的对比坐标
这位创作者的核心论点很直接:还记得当年ChatGPT 3.5 Turbo刚问世的时候吗?
那时候,互联网上充斥着这样的声音——"看来软件工程要完蛋了,兄弟们(looks like software engineering is over, boys)"。无数开发者被3.5 Turbo的表现震撼,甚至开始担忧自己的职业前途。它一度被视为改变行业的分水岭。
技术里程碑回顾:3.5 Turbo的突破性
ChatGPT 3.5 Turbo于2023年初发布,是OpenAI在GPT-3.5基础上针对对话场景优化的版本。它采用了RLHF(基于人类反馈的强化学习)技术——这一技术的核心流程分为三步:首先用监督学习微调预训练模型,然后让人类标注员对多个模型输出进行偏好排序来训练一个奖励模型(Reward Model),最后使用PPO(近端策略优化)算法让语言模型的输出最大化奖励模型的评分。这一技术最早由OpenAI在InstructGPT论文中系统化提出,后来成为ChatGPT成功的核心秘密。值得注意的是,RLHF并非没有争议——它可能导致模型过度迎合人类偏好(所谓的"sycophancy"谄媚问题),也可能使模型在安全性上过度保守。后续的DPO(Direct Preference Optimization)等方法试图绕过奖励模型的训练步骤,简化整个对齐流程。
相比前代,3.5 Turbo的响应速度提升了约25%,成本降低了90%,这使得它成为首个真正实现商业化大规模部署的对话AI。当时,它在代码生成、文本创作和问答等任务上的表现让开发者社区震惊,被认为是"iPhone时刻"级别的技术突破。
然而放到今天的坐标系里回看,创作者毫不客气地评价:"ChatGPT 3.5 Turbo相比现在的Gemini,简直就是垃圾(absolute garbage)"。

这句略显夸张的表述背后藏着一个真实的技术现实:模型能力的迭代速度快到让我们不断刷新"及格线"。这种快速迭代背后有其理论基础——Scaling Laws(缩放定律)。2020年,OpenAI研究者Kaplan等人发现,模型性能与参数量、训练数据量、计算量之间存在幂律关系:只要持续增加这三个要素,模型性能就会持续且可预测地提升。这一发现直接催生了"大力出奇迹"的训练范式。然而到2024-2025年,行业开始意识到单纯的预训练缩放可能正在遭遇收益递减,于是"测试时计算"(Test-time Compute)成为新的前沿方向——通过在推理阶段让模型进行更多的"思考"(如链式推理、自我验证),用推理阶段的算力换取更高的输出质量。OpenAI的o1系列和Google的Gemini 2.5 Pro都采用了这一思路,这也解释了为何新一代模型在复杂推理任务上的提升尤为显著。
从2020年GPT-3到2025年的Gemini 2.5 Pro,顶级模型在标准基准测试上的得分每6-9个月就会有显著跃升。例如,GPT-3.5在代码生成任务HumanEval上的通过率约为48%,而GPT-4达到67%,Claude 3.5 Sonnet达到92%,短短两年内提升了近一倍。我们对AI的期待值随着每一次发布水涨船高,以至于忘记了自己曾经为哪个版本欢呼过。
AI模型评价中的认知双重标准
创作者进一步戳破了一个尴尬的真相。他指出,那些今天嘲笑Gemini新版本的人当中,有一半在当年正是对着ChatGPT 3.5 Turbo惊叹"这就是未来"的那批人。
"你们当中有一半人,当年看着3.5 Turbo说:'这就是我要的(that's me)'。你以为呢?你真的以为那就是极限了。"

这里揭示了一种典型的认知偏差:我们总是用当下最先进的产品作为唯一的参照系,来贬低所有新产品的不足,却选择性遗忘了技术进步的绝对幅度。
换句话说,今天被吐槽"不够好"的Gemini新版本,其绝对能力早已把当年那个让所有人惊呼"软件工程要终结"的模型甩在身后。我们批评的不是模型退步了,而是我们的期待值涨得太快。
理解评测的局限性
这种认知偏差部分源于AI评测方法论的局限。当前AI领域的主流评测基准各有侧重:MMLU(Massive Multitask Language Understanding)包含57个学科的选择题,测试模型的广泛知识储备;HumanEval由164道Python编程题组成,评估代码生成能力;GSM8K包含8500道小学数学应用题,测试多步推理能力;而ARC(AI2 Reasoning Challenge)则侧重科学常识推理。然而这些基准面临严重的"数据污染"(Data Contamination)问题——测试题可能已出现在模型的训练数据中,导致分数虚高。此外,基准测试的选择题格式与真实应用场景差距很大,一个在MMLU上得分95%的模型在实际开放式对话中可能表现平平。这也是为什么社区越来越重视Chatbot Arena这类基于真实用户盲评的动态排行榜,以及SWE-bench(软件工程任务)等更贴近实际工作场景的评测。
更重要的是,缺乏历史对比基准的评测容易陷入"锚定效应"——人们仅以当前最强模型为参照系,而忽略了纵向的进步幅度。当3.5 Turbo的4K上下文窗口在2023年初还被认为是"足够用"时,今天的Gemini 2.5 Pro已经提供了超过100万tokens的上下文能力。从4K到100万tokens,这一跨越背后涉及多项关键技术创新:标准Transformer架构的自注意力机制计算复杂度为O(n²),上下文长度翻倍意味着计算量将增至四倍。为突破这一瓶颈,研究者们发展了稀疏注意力(Sparse Attention)、滑动窗口注意力(Sliding Window Attention)、RoPE(旋转位置编码)外推技术以及Ring Attention等分布式推理方案。这些技术的叠加使得百万级上下文成为可能,但长上下文中的"迷失在中间"(Lost in the Middle)问题——模型对序列中间部分的信息检索能力弱于首尾——仍然是活跃的研究方向。这本身就是数量级的技术跨越。

AI进化背后的三个技术启示
这段看似调侃的评论,实际上触及了AI行业一个值得警惕的现象。
期待值的通货膨胀正在扭曲判断
每一代模型都在重新定义"合格"的标准。当GPT-3.5让人惊艳时,我们的基准线还很低;当GPT-4、Claude、Gemini陆续登场后,基准线被不断推高。今天的"平庸",在两三年前可能就是"神迹"。
这种"能力通货膨胀"现象在AI领域尤为显著。研究表明,大语言模型的能力提升速度甚至快于芯片领域的摩尔定律——后者是每18-24个月晶体管密度翻倍,而前沿AI模型的基准测试得分在某些任务上每6-9个月就能实现显著跃升。去年被认为是"超级智能"的表现,今年可能仅被视为"基本合格"。这种期待值的持续通胀,让我们越来越难以客观评价单个模型的真实价值,也让开发者和用户形成了"永远不满足"的心理状态。心理学中的"享乐适应"(Hedonic Adaptation)理论可以部分解释这一现象:人类天生会快速适应新的刺激水平,并将其视为"新常态",从而需要更强的刺激才能获得同等的满足感。
评价AI模型需要历史纵深
单纯用"它犯了什么错"来评判一个模型是片面的。更有价值的评估方式是把它放进技术演进的时间轴里:相比半年前、一年前的同类产品,它进步了多少?解决了哪些过去无解的问题? 只盯着缺点而忽视进步曲线,容易得出失真的结论。
这需要建立一种"纵向对比"的评测思维。例如,GPT-3.5的上下文窗口仅4K tokens,且在复杂推理任务上常常出现逻辑错误——它无法可靠地执行超过3步的数学推理链,在代码调试中经常"修一个bug引入三个新bug";而今天的Gemini 2.5 Pro不仅拥有百万级上下文,在多步推理、代码调试、多模态理解等任务上也有质的飞跃。更关键的是,新一代模型引入的"测试时计算"范式使得它们能够在遇到复杂问题时自主分解任务、验证中间步骤,这是GPT-3.5时代完全不具备的能力。如果我们仅关注它在某个边界案例下的失误,而忽略了这些绝对能力的提升,就会陷入"只见树木不见森林"的误区。
开发者需要调整心态拥抱工具进化
对于开发者而言,这段话也是一剂清醒剂。与其在社交媒体上比拼谁能挖出模型更离谱的失误,不如思考如何在现有能力边界内充分利用这些工具。毕竟,那个曾让你担忧"软件工程要完蛋"的模型,如今已成了你眼中"不够看"的东西——这本身就说明了工具进化的速度,也说明了人类适应与驾驭工具的能力。
更重要的是,理解AI模型的"能力边界"比单纯批评其失误更有价值。每一代模型都有其擅长和不擅长的领域,理解这些边界并设计合理的工作流,才是真正将AI工具转化为生产力的关键。例如,当前最先进的模型在结构化数据分析、长文档摘要、代码重构等任务上已经能显著提升效率,但在需要最新实时信息、高度专业化的领域知识或涉及复杂物理推理的场景中仍有明显局限。成熟的AI应用策略不是期待模型"无所不能",而是通过RAG(检索增强生成)、Agent工作流、人机协作等架构设计,将模型的优势与人类判断力有效结合。当我们过度关注失败案例时,往往会忽略那些已经被AI显著提升效率的实际应用场景。
结语:对AI技术进步保持敬畏,也保持清醒
这位创作者用一种幽默而略带讽刺的方式,提醒我们重新审视对AI的态度。嘲笑新模型的不足很容易,但如果能记住我们曾经为哪些"如今看来不堪"的版本激动过,也许会对技术进步多一分敬畏,少一分傲慢。
AI的发展是一条陡峭的曲线。今天我们眼中的"垃圾",可能正是几年前我们梦寐以求的"未来"。而今天让我们不满意的Gemini,很可能在不远的将来,成为我们回头看时又一个"当年真好"的注脚。
技术进步从来不是线性的,而是在每一次迭代中累积起来的指数级跃升。从Scaling Laws驱动的参数规模扩张,到RLHF和DPO带来的对齐能力提升,再到测试时计算开启的推理能力新范式,每一次技术突破都在重塑我们对"智能"的定义。当我们批评一个新模型时,不妨问自己:它真的退步了吗?还是只是我们的期待值又涨了一轮?保持这种历史纵深的视角,我们才能更准确地评估AI的真实价值,也更理性地规划它在实际工作中的应用边界。
核心要点
- 认知双标现象:开发者用当下最强模型作为唯一参照系,选择性遗忘技术进步的绝对幅度,这种"享乐适应"效应在技术社区中尤为显著
- 历史对比坐标:今天被批评的Gemini在绝对能力上已远超当年让人惊叹的ChatGPT 3.5 Turbo,无论是上下文长度、推理能力还是多模态理解
- 能力通货膨胀:AI模型能力每6-9个月显著跃升,从Scaling Laws到测试时计算的范式转移持续推动进步,期待值持续攀升导致"永远不满足"
- 评测方法论缺陷:红队测试和社交传播放大失败案例,标准基准面临数据污染问题,缺乏纵向对比导致认知失真
- 技术进步的敬畏:从4K上下文到百万tokens(涉及稀疏注意力、RoPE外推等关键创新),从48%到92%的代码通过率,两年内实现数量级突破
- 实用主义态度:理解模型能力边界并通过RAG、Agent工作流、人机协作等架构设计合理工作流,比单纯批评失误更有价值
相关推荐

AI Agent项目启动指南:四步搭建通用工作流框架
从零开始搭建AI Agent工作流,借鉴程序员项目管理思路,通过建文件夹、写System Prompt、整理项目说明和进度记录四个步骤,掌握一套可复用到任何任务的AI协作启动方法论。

特斯拉Cybercab量产:没有方向盘的车如何重构出行商业逻辑
特斯拉Cybercab是一款无方向盘、无踏板的双座无人驾驶出租车,标志着特斯拉从卖车向出行服务平台转型。本文深度解析Cybercab的商业逻辑、技术挑战与监管风险,探讨这款车为何被称为特斯拉的"分岔路口时刻"。

AI时代创业公司ARR为何变得脆弱?应对策略全解析
AI时代企业采购逻辑剧变,创业公司ARR(年度经常性收入)面临前所未有的脆弱性。本文深入分析ARR不再稳固的核心原因,包括采购周期缩短、技术护城河贬值、估值逻辑重构等挑战,并提供构建差异化壁垒与提升收入质量的实战应对策略。