Gemini拒绝联网搜索?AI"过度自信"问题深度解析

一位用户的"崩溃"吐槽
最近,一位Reddit用户发帖吐槽,标题带着明显的情绪:"Gemini最近是彻底坏了吗,还是只有我遇到这问题?(这种'煤气灯效应'太离谱了)"。帖子迅速引发大量共鸣,核心问题直指Google旗下大模型Gemini在联网搜索(web search)工具调用上的可靠性严重下滑。
值得注意的是,大语言模型的联网搜索能力本质上是一种**工具调用(Tool Use / Function Calling)**机制。模型本身并不能直接上网,而是通过判断何时需要外部信息,向宿主系统发出结构化的"搜索请求",由宿主系统执行真实的网络检索后,将结果以文本形式返回给模型,再由模型整合进最终回答。这个流程依赖两个关键环节:一是模型必须正确判断"这道题需要联网",二是模型在收到搜索结果后必须优先采信外部内容而非内部知识。任何一个环节出问题,都会导致用户感知到的"搜索失灵"。
发帖者描述的场景,不少AI重度用户应该都不陌生:明明问的是近期新闻、硬件泄露信息或时事动态,Gemini却不做联网查询,固执地依赖过时的训练数据,还态度笃定地否认这些新信息的存在。

三宗"罪":忽略指令、凭空幻觉与居高临下
根据原帖的梳理,Gemini的问题主要体现在三个方面:
第一,无视搜索指令。 即便用户明确输入"上网搜一下这个"或使用自定义触发提示词,Gemini依然直接绕过搜索工具,完全不联网。
第二,依赖旧数据并产生幻觉。 模型退回到内部知识库,"百分之百确信"地声称任何更新的信息都不存在。**AI幻觉(Hallucination)**是指大语言模型生成听起来合理、实则不准确或完全捏造的内容,其根源在于模型通过统计规律预测"下一个词最可能是什么",而非通过逻辑推理验证事实真伪。更危险的是"过度自信"变体:当用户提供的真实信息与模型参数中的旧数据冲突时,模型有时会"选择"坚守经过大量训练强化的旧内容,以高置信度否定用户输入。这一现象在学界被称为"知识冲突"(knowledge conflict),是当前LLM可靠性研究的核心课题之一。
第三,用说教语气"反驳"用户。 这是最让人恼火的一点,也是发帖者借用**"煤气灯效应"(Gaslighting)**来描述体验的原因所在。"煤气灯效应"源自1944年的同名电影,指通过持续否定、误导让对方质疑自身判断和感知的心理操控行为。当AI用笃定的语气、甚至带有嘲讽情绪的表达方式否认真实存在的事件时,用户明明掌握着真实信息,却被一个"权威"角色反复"纠正",这种体验已经不只是功能失效,而是主动破坏了人与系统之间的信任关系。模型不去质疑自己的知识截止日期,反而假设用户被钓鱼帖、梗图或假新闻骗了,甚至会带着笑哭表情符号"教育"用户,说对方提供的信息是"虚构的"——而实际上,只要两秒钟的Google搜索就能验证这些信息真实存在。
发帖者提到,自己在讨论近期硬件技术和已确认的政治任命时,Gemini一直争辩、否认现实,直到他不得不手动把截图"怼到它脸上",模型才罢休。
为什么会出现"过度自信"?
这个案例揭示了当前大语言模型(LLM)的一个典型痛点,有必要从技术角度拆解其成因。
知识截止日期与"全知"错觉
所有大模型都有一个训练数据截止日期(knowledge cutoff)。大语言模型的训练过程需要消耗海量算力,通常以月甚至年为周期进行一次。训练结束后,模型的参数便被固化,所有在截止日期之后发生的事件对模型来说都是"未来"——它没有直接感知这些信息的途径。以2025年真实发生的重大事件为例:Trump于4月2日宣布的大规模对等关税、缅甸7.7级强震、Marine Le Pen被禁止参选等,若发生在某个模型的知识截止日期之后,该模型在没有联网工具的情况下将完全无从知晓。这正是实时联网搜索对现代AI产品不可或缺的根本原因。
然而问题在于,模型并不真正"知道自己不知道什么"。它生成回答时,基于概率预测下一个最可能的词,而非基于对事实的真正理解。当用户提供的信息与训练数据冲突时,模型有时会"选择"相信自己参数里的旧知识——因为那是训练时被强化过的"高置信度"内容。从用户视角看,这种表现就是傲慢的"过度自信"。
工具调用阈值可能被悄悄调整
发帖者提出了一个关键猜测:Google是否在近期更新中悄悄调高了联网搜索的触发阈值?
这个推测有一定道理。在AI Agent的工程实现上,模型需要维护一个内部的"工具触发决策":针对每一条用户输入,判断是否需要调用外部工具。这个判断本质上是一个概率阈值问题——当模型对某个问题的"自信度"超过某个阈值时,便倾向于直接作答而不搜索;低于阈值时才触发检索。对于Google这样面向数亿用户的产品,每次联网搜索都意味着实实在在的算力和API成本。如果为了降低运营开支或提升响应速度而调高了这个判断阈值,就可能导致模型在本该搜索的场景下变得"偷懒",直接用内部知识作答。
这类后台调整通常不会出现在公开的更新日志里,用户只能通过体验的骤降来感知。这也解释了发帖者为何用"quietly changed(悄悄改了)"这样的措辞。
这不只是Gemini的问题
理性地看,工具调用不稳定和AI幻觉问题并非Gemini独有,这是整个行业面临的共性挑战。
主动检索是所有AI Agent的难题
让模型自主判断何时该调用外部工具,本身就是AI Agent能力建设中的核心挑战之一。AI Agent(智能体)是指能够感知环境、自主规划并调用外部工具完成复杂任务的AI系统,联网搜索是其最基础的工具之一。判断太保守,模型就会像本案例一样漏掉必要的搜索;判断太激进,又会导致每个简单问题都触发不必要的检索,浪费资源、拖慢速度。
不同厂商在这个平衡点上的取舍各不相同。发帖者也提到,相比之下"其他模型在被要求时确实会去搜索",说明各家产品在触发策略上确实存在明显的体验差异。
"过度自信"的态度才是最大问题
比起搜不到信息,更让用户反感的其实是模型的态度。当AI用说教、嘲讽的口吻否定用户提供的真实信息时,它破坏的是最基本的用户信任。
一个理想的AI助手应当具备认知谦逊(Epistemic Humility)——即对自身知识边界保持清醒认知的能力,知道自己知道什么,更知道自己不知道什么。面对超出自身知识范围的信息时,应当主动声明"我的训练数据可能未覆盖此事件,建议联网核实",而非用假性权威压制用户的正确信息。OpenAI、Anthropic等头部机构均将"校准不确定性"(calibrated uncertainty)列为模型安全性和可信度的核心指标。从这个角度看,Gemini此次引发的争议,实质上是产品在认知谦逊维度上的设计退步——而这恰恰是最难用参数量或基准测试来衡量的能力。
给用户的几点实用建议
在厂商完成优化之前,可以通过以下方法规避Gemini搜索失灵的问题:
- 明确提供时间锚点。 提问时补充具体时间信息,帮助模型意识到内容超出其知识截止范围。
- 强制要求引用来源。 要求模型"提供搜索到的链接和出处",间接迫使它联网检索,而非凭空作答。
- 善用多模型交叉验证。 对于时效性强的查询,同时在几个不同的AI模型上验证,避免被单一模型的"自信"误导。
- 及时反馈问题。 通过产品内的反馈渠道报告搜索失灵问题,这是推动厂商调整策略最直接的方式。
结语
这位Reddit用户的吐槽,表面上是对Gemini的一次功能抱怨,深层却触及了当下AI产品最核心的矛盾:能力与可靠性之间的落差,以及模型"态度"对用户体验的巨大影响。
随着大模型越来越多地被用于实时信息研究和动态追踪,联网搜索工具调用的稳定性、以及模型面对未知时的谦逊程度,将成为衡量AI产品是否真正好用的关键指标。技术参数固然重要,但一个动辄否定用户、拒绝核实的AI助手,无论模型多大,都难以真正赢得用户的信任。
核心要点
相关推荐

KV缓存作为运行时:AI智能体交互的第三条路径
深度解析Yandex团队提出的KV缓存运行时方案,探讨如何通过操纵模型推理状态实现低成本、实时的智能体交互能力提升,超越传统模型训练和提示工程的局限。

1024字节实现Python解释器:代码高尔夫的极限挑战
深入解析如何在仅1KB空间内实现Python解释器子集,涵盖词法分析、语法解析、求值器等核心组件的极限压缩技巧,探讨代码高尔夫对理解编译原理和解释器设计的独特价值。

AWS Agent Code Payments详解:AI代理自主支付基础设施全解析
深入解析AWS Agent Code Payments服务,了解AI代理如何通过X402协议实现自主支付。涵盖钱包安全管理、会话级预算控制、WAF AI流量变现等核心功能,以及Coinbase和Stripe集成方案。