谷歌图片搜索出现神秘代码:AI幻觉问题再引关注

一次普通搜索引发的困惑
近日,一位Reddit用户分享了自己在使用谷歌图片搜索时遇到的诡异经历,迅速引发了社区讨论。这位用户表示,自己原本只是想搜索一些关于数字命理学(numerology)的相关内容,却在搜索结果中被AI推送了一堆令人费解的信息。
数字命理学是一种将数字赋予神秘含义的信仰体系,其核心主张缺乏科学实证支持。对于AI模型而言,这类内容在训练数据中的表现形式极为混杂:既有严肃的学术批评,也有大量信奉者编写的解读文本,还混杂着各种符号系统和计算规则。正是这种数据的混乱性,为后续的异常输出埋下了伏笔。
据其描述,搜索结果中出现了神秘的字谜(anagram)、来历不明的代码,比如(A)、x-10,以及一长串带着大量零的数字——看起来就像是数学中著名的"古戈尔"(googol,即10的100次方)。值得一提的是,"Google"这个公司名称本身就源自对"googol"的创意拼写变体,这种巧合让整个事件更添了一层荒诞色彩。

这种看似毫无逻辑、拼凑而成的输出,让用户感到既困惑又好奇。这究竟是搜索引擎的bug,还是AI在"胡言乱语"?
AI幻觉:谷歌搜索结果为何变得离奇
什么是AI幻觉
这一现象背后,很可能与当前搜索引擎大规模集成生成式AI有关。谷歌近年来在搜索中深度整合了AI概览(AI Overviews)等功能,试图用大语言模型直接为用户生成答案,而不再仅仅是罗列网页链接。
谷歌AI Overviews(原名SGE,即Search Generative Experience)是谷歌自2023年开始逐步推出的搜索功能,它利用Gemini系列大语言模型在搜索结果页面顶部直接生成摘要性答案。与传统搜索仅展示网页链接不同,AI Overviews试图理解用户意图并综合多个网页信息生成连贯回答。这一功能于2024年5月在美国全面上线,随后扩展至全球更多市场,深刻改变了数十亿用户的信息获取方式。
然而,大语言模型存在一个大家都知道的问题——"幻觉"(hallucination)。从技术机制上看,大语言模型的幻觉源于其根本工作原理——基于概率的下一个词预测。模型并不真正"理解"信息的真伪,而是根据训练数据中的统计模式生成看起来流畅连贯的文本。当查询涉及训练数据稀疏或矛盾的领域时,模型会基于表面的模式匹配进行"插值",生成看似合理但实际上毫无事实依据的内容。研究表明,幻觉率与查询领域的知识确定性呈负相关——越是模糊、缺乏共识的领域,幻觉发生的概率越高。
当模型在处理边缘化、低质量或本身就充满伪科学色彩的查询时(比如数字命理学这类缺乏权威数据支撑的领域),它更容易生成看似合理实则毫无根据的内容。
为何数字命理学查询更容易触发AI错误输出
数字命理学本身就是一个充斥着符号、代码和数字联想的领域。当AI试图在这类内容上生成结果时,由于训练数据中相关信息来源相互矛盾、缺乏统一逻辑框架,模型很容易把训练数据中的各种符号、公式片段错误地拼接在一起,形成(A)、x-10以及超长数字这样看似神秘、实则无意义的组合。
这种现象在自然语言处理研究中被称为"语义漂移"(semantic drift)——模型在缺乏明确语义锚点的情况下,会逐渐偏离有意义的内容生成轨道,最终输出与查询意图完全脱节的文本片段。
换句话说,AI并不是发现了什么"隐藏的宇宙密码",而是在缺乏可靠信息源的情况下,进行了一次"自信满满"的错误推理。
生成式搜索的双刃剑:便利与准确性的博弈
用户容易被误导的风险
这起看似有趣的小事件,实际上折射出生成式搜索的深层隐忧。当AI直接以"答案"的形式呈现内容时,普通用户往往缺乏辨别真伪的能力。对于命理、占卜这类本身就模糊的领域,AI生成的伪代码反而可能被误解为"神秘启示",加剧误导。
从信息检索的范式角度来看,这里发生了一次根本性转变。传统搜索引擎本质上是信息索引系统,它通过PageRank等算法对网页进行排序,用户需要自行点击链接、阅读原文并做出判断。而生成式搜索则将这一过程压缩为直接呈现"答案",这从根本上改变了用户与信息的关系——从"主动检索者"变为"被动接收者"。这种范式转变带来的风险在于,它剥夺了用户评估信息来源可靠性的机会,同时将判断真伪的责任从用户转移到了AI模型本身。
更值得警惕的是,谷歌AI概览此前就曾因给出荒谬答案而广受批评——比如建议用户"在披萨上涂胶水"或"每天吃石头补充矿物质"。这些案例发生在2024年5月AI Overviews全面上线后不久,经调查发现,"胶水披萨"建议源自一条Reddit上的讽刺评论,而"吃石头"建议则追溯到一篇讽刺文章。这些事件暴露了AI Overviews在信息源质量筛选方面的严重缺陷——模型无法区分严肃内容与讽刺内容、权威来源与用户生成内容。谷歌随后紧急调整了该功能的触发阈值和内容过滤机制,但显然问题并未完全解决。这次的神秘代码事件,本质上是同类问题的又一次显现。
面对AI生成异常内容的应对策略
对于普通用户而言,面对搜索引擎中AI生成的异常内容,最理性的做法是保持怀疑态度:
- 不要将AI生成的内容视为权威事实,尤其是涉及伪科学话题时
- 对于看似"神秘"的代码或数字,应意识到这很可能是模型的错误拼接
- 重要信息务必通过多个可靠来源交叉验证
- 留意AI生成内容的标识标记,区分AI摘要与原始网页内容
- 当AI答案涉及健康、法律、金融等高风险领域时,务必咨询专业人士
结语:AI搜索时代需要更强的信息辨别力
这位Reddit用户的经历,看似只是一次好笑的"撞见",却提醒我们:在AI深度介入信息检索的时代,我们获得的"答案"未必真实可靠。
生成式AI确实带来了前所未有的便利,但它同样会以极其自信的姿态输出错误内容。这种"自信的错误"在心理学中被称为"自动化偏见"(automation bias)——人类倾向于过度信任自动化系统的输出,尤其当这些输出以权威、确定的语气呈现时。当搜索引擎从"信息索引者"转变为"答案生成者"时,如何在便利性与准确性之间取得平衡,将是谷歌等科技巨头必须长期面对的课题。
目前,业界提出的解决方向包括:增强检索增强生成(RAG)技术以锚定真实来源、引入不确定性表达让模型承认"不知道"、建立更严格的信息源可信度评估机制等。但在这些技术完善之前,对于每一位用户来说,培养批判性思维、不盲信AI,或许才是这个时代最重要的"数字素养"。
相关推荐

Claude Code入门指南:终端AI编程工具安装与选型全解析
详解Claude Code终端AI编程工具的核心特点、安装配置方法,对比终端Agent与设备Agent两大方向,推荐Claude Code搭配DeepSeek的实用组合方案,帮助开发者快速上手AI编程。

没有博士学位,AI研发岗存在隐形天花板吗?
没有博士学位能否在AI研发岗走到底?本文从顶级研究实验室到工业界产品团队,分析硕士工程师在计算机视觉等AI领域的职业天花板、IC技术专家路线、破局策略,以及是否值得读博的成本收益判断。

地球上最长直线路径:32089公里不碰陆地是怎么算出来的
地球上最长的直线路径有多长?从巴基斯坦到堪察加半岛的32089公里海上直线,以及从连云港到里斯本的11241公里陆地直线,背后是大圆路径与分支定界算法的精妙结合。