实测120道选型问题:ChatGPT、Perplexity与Gemini推荐重合率仅14%

120道工具选型题实测四款AI引擎,42%的问题推荐结果毫无交集,中位重合率仅0.14。
一位Reddit用户用120道真实工具选型问题对比了四种AI引擎配置(联网/离线ChatGPT、Perplexity、Gemini),发现42%的题目四方推荐产品零重合,中位Jaccard相似系数仅0.14,37%的被推荐产品只被单一引擎提及。分歧最大的是MCP工具类别,19题中12题零重合。即便是同一个ChatGPT,开启与关闭联网搜索的名单重合率也只有29%,揭示出参数化记忆与实时检索两种机制各自引入了不同偏差。实验仅测一致性、非准确性,且为单次采样,作者坦承局限并计划重复验证。核心结论是:AI推荐偏向高知名度产品,对新兴工具存在系统性盲区,不宜直接用于采购决策,应交叉多引擎并保留人工验证环节。
把一个购买决策交给AI代理,答案很大程度上取决于你交给了哪个引擎。一位Reddit用户用120道真实的工具选型问题做了对照实验,结果比很多人预想的都要分裂:四个引擎中有42%的问题,推荐出的产品名单没有任何一个重合。

实验设计:120道选型问题,六大类别
作者收集了120道人们在挑选工具时真实会输入的问题,比如「最好的X API」「最便宜的Y」「Z的替代品」等。这些问题覆盖六个类别:线索数据增强(lead enrichment)、Clay替代品、面向智能体的MCP工具、AI可见度追踪、SEO数据API,以及邮箱验证。
每道题分别发给四个「引擎配置」:开启联网搜索的ChatGPT、关闭联网搜索的ChatGPT、Perplexity,以及Gemini。总共480次调用,返回了472条有效回答。之后作者统计每条回答里出现了哪些产品名称,用手工整理的品牌列表做字符串匹配。
这套方法的粗糙之处作者自己也坦承:它只做名称匹配,任何没被列进品牌表的产品都是「隐形」的;而且没有人验证这些推荐到底靠不靠谱,所以实验说的是一致性,不是准确性。
线索数据增强(Lead Enrichment) 是指通过第三方数据源对已有的潜在客户记录进行补全和丰富,例如补全公司规模、联系人职位、邮箱地址或技术栈等字段。这类工具在B2B销售自动化中被广泛使用,典型产品包括Apollo、Clearbit、ZoomInfo等。MCP(Model Context Protocol) 是由Anthropic于2024年底提出的开放协议,旨在标准化AI模型与外部工具、数据源之间的交互方式,使智能体能够以统一接口调用文件系统、数据库、API等资源。由于该协议发布时间较短,市场上相关工具层出不穷但尚未形成稳定格局,这也解释了为何MCP类别在本实验中呈现最高的引擎分歧——各模型的训练数据和实时检索结果对这一新兴生态的覆盖差异极大。
核心发现:42%零重合,中位重合率仅0.14
在四个引擎都作答的112道问题中,有47道(42%)四方推荐没有任何一个产品交集。用「交集除以并集」计算的重合度中位数只有0.14。换句话说,四个引擎给出的名单,绝大部分内容各说各话。
更夸张的是分散程度:所有被提及的产品里,37%只被某一个引擎点名,其余三个引擎完全没提。这意味着超过三分之一的推荐是「孤例」——如果你恰好用了另一个引擎,就永远看不到它。
六个类别中表现最割裂的是「面向智能体的MCP工具」:19道题里有12道零重合。这类新兴领域缺乏稳定共识,模型的知识储备和检索结果差异被进一步放大。
实验使用的重合度计算方式是 Jaccard 相似系数(交集大小除以并集大小),这是信息检索和集合比较领域的常用指标,取值范围为0到1。当四个引擎推荐的产品完全一致时,Jaccard系数为1;完全没有交集时为0。中位数0.14意味着:在所有被四个引擎合并列出的产品中,平均只有约14%的产品被它们共同提及,其余86%是某些引擎独有的推荐。这个数字之所以有参考价值,在于它排除了列表长度不同带来的干扰——即使某个引擎给出了更长的推荐清单,Jaccard系数依然能客观反映重叠程度。
同一个引擎,开不开搜索也不一样
一个容易被忽略的细节:即便是同一个ChatGPT,联网搜索开与关,两份名单的重合率也只有29%。这说明差异不只来自厂商之间的模型区别,还来自是否引入实时检索这一变量。开启检索会把答案拉向当下网络上更热门的内容,而关闭时则更依赖模型训练时的记忆。
作者还提到一个让他发笑的现象:当你要求「Clay的替代品」时,95%的回答里居然还是包含Clay本身。这暴露了模型在处理「排除类」查询时的常见缺陷——它会把被排除的对象当成强相关结果直接返回。
这里涉及大语言模型的两种不同知识来源机制。参数化记忆(Parametric Memory) 指模型在预训练阶段将知识压缩编码进神经网络权重中,回答时无需联网,但存在知识截止日期(Knowledge Cutoff)的限制,且对训练数据中曝光度低的产品存在系统性遗漏。检索增强生成(RAG, Retrieval-Augmented Generation) 则是在推理时实时抓取外部文档或网页内容,再将其拼入提示词供模型参考——联网搜索本质上就是一种RAG实现。RAG可以获取最新信息,但结果受搜索引擎排名、SEO优化程度等因素影响,知名度高的产品往往在检索结果中更靠前。这两种机制叠加了各自不同的偏差来源,使得「同款模型、不同检索状态」的输出差异达到实验中观测到的71%不重合程度。
实验的局限:一次采样不足以下结论
作者对自己的实验保持了难得的克制。他明确指出这是一次性采样、单日进行、没有重复测试,而重复正是他计划下周要补做的工作,之后才敢声称这些数字是稳定的。
单次采样的问题在于,大模型的输出本身带有随机性,同一问题多次询问也可能得到不同答案。因此当前42%的零重合率里,有多少是引擎间的系统性差异,有多少只是采样噪声,目前还无法区分。这也是这类对比实验普遍需要警惕的地方。
启示:不要把「买哪个工具」直接交给模型
作者本人的主业正好落在这六个类别之一。在人员和邮箱查询上,他使用一个叫Treg的按次计费聚合层——一个密钥、一个余额,背后按价格和命中率自动挑选邮箱服务商,省去逐个厂商注册的麻烦。而这个工具在472条回答里出现了零次。
他对此并不意外:对于一个小众且新的产品,被忽略是意料之中的。但这恰恰是他不再向模型询问「该买哪个工具」的原因——模型的推荐既有显著的引擎间偏差,又天然偏向知名度高的产品,对新兴或小众方案存在系统性盲区。
对于依赖AI辅助做采购或选型决策的团队,这个实验给出的实际提醒是:把模型的推荐当作起点而非结论,尤其在新兴技术领域,最好交叉多个引擎,并保留自己验证的环节。指望单一AI给出「最优工具」,很可能只是得到了那个引擎的偏好而已。
相关推荐

一场与Grok的对话能否影响重大决策?素材不足的警示
一则关于美国因与Grok对话影响委内瑞拉决策的Hacker News标题引发关注,但缺乏正文与信源。本文探讨此类耸动标题的识别方法与AI在决策中的真实边界。

AI编程为何离不开Git?从版本回退到AI辅助命令全解析
Git是AI编程的必备工具。本文解析Git分布式版本控制在AI编程中的价值,包括应对AI幻觉的版本回退、分支管理等核心操作,以及如何用豆包、AI输入法等工具快速生成Git命令,帮助新手零基础入门。

拒绝AI胡编:一款"说不了谎"的求职信生成器是如何炼成的
一位开发者因AI求职信工具凭空捏造其Kubernetes经验和管理经历而屡遭拒信,于是打造了CoverCraft——通过代码计算评分、GitHub提交记录背书、对抗性审查与人工审批四重机制,构建一款"无法说谎"的AI求职信生成器。本文解析其对抗AI幻觉的工程设计。