45次是非问能否让LLM认出16张牌?信息论视角的AI推理测试

一个考验推理能力的信息论谜题
在人工智能能力评测日益复杂的今天,一个来自 Hacker News 的实验引发了讨论:大语言模型(LLM)能否仅通过45次「比特查询」(即只能回答是/否的二值问题)准确识别出16张卡牌?
这个看似简单的谜题,实际上触及了信息论、约束推理与LLM工作机制的核心。它不像常见的数学题或代码题那样有标准答案套路,而是要求模型在信息受限的条件下,做出高效、无冗余的策略性决策。

为什么是「45次」这个数字?
要理解这个挑战的难度,需要先从信息论的角度算一笔账。
信息论基础:比特与香农熵
在深入计算之前,有必要回顾信息论的基本框架。信息论由克劳德·香农于1948年在其里程碑式论文《通信的数学理论》中创立,其核心洞见是用「比特」(bit)作为信息的基本度量单位。一个比特代表一次二元选择所能传递的信息量。香农熵公式 H = -Σ p(x) log₂ p(x) 定义了一个随机变量的平均信息量(即不确定性)。
在本文的卡牌识别问题中,每个是/否问题最多传递1比特信息,但这个上限只有当问题将可能性恰好二等分时才能达到。如果一个问题的答案有90%概率是「是」,那么它实际传递的信息量远小于1比特(约0.47比特),因为答案的不确定性本身就很低。理解这一点对于评估LLM提问策略的质量至关重要。
理论下限的计算
识别16张卡牌,如果每张牌有其唯一身份,我们需要区分的信息量取决于卡牌的可能状态。假设是标准扑克牌,单张牌有52种可能,识别一张牌理论上需要 log₂(52) ≈ 5.7 比特,即至少6次是非问答。
但题目中的16张牌若是从某个已知集合中排列组合,问题就变成了「用二分法逐步缩小范围」。每一个是非问题理想情况下能排除一半可能性,因此45次查询提供了 2⁴⁵ 的信息空间——这个数字远超16张牌所有排列组合所需的信息量。
关键在于「效率」而非「可能性」
从纯理论看,45次查询绰绰有余。真正的挑战不在于「能不能」,而在于LLM能否设计出接近最优的提问策略:
- 每次提问是否都能有效切割搜索空间?
- 模型能否根据前序回答动态调整后续问题?
- 会不会出现信息冗余或逻辑死循环?
这恰恰是LLM推理能力的试金石——它考验的不是记忆,而是在线的、自适应的策略规划。
信息增益:什么是「好问题」?
信息增益(Information Gain)这一概念源自决策树学习中的经典理论,衡量一个查询对减少不确定性的贡献。在ID3/C4.5等经典决策树算法中,选择信息增益最大的属性作为分裂节点,本质上就是在做「最优提问」——这与卡牌识别中的策略设计如出一辙。
在卡牌识别问题中,最优策略类似于构建一棵霍夫曼树:每次提问应尽可能将剩余候选集等分。例如,问「这张牌是红色花色吗?」能将52张牌分成26:26,获得完整1比特信息;而问「这张牌是黑桃A吗?」则是1:51的切分,信息增益极低(约0.08比特)。LLM能否自发地遵循这种最大熵原则提问,而不是退化为逐一枚举,是衡量其推理深度的关键指标。
LLM在这类任务中的真实表现
二分搜索的直觉与陷阱
对人类工程师而言,「二分查找」是本能。但LLM在执行多轮交互式推理时,往往暴露出几个典型问题:
状态追踪困难。随着问答轮次增加,模型需要在上下文中维护「已排除」和「待确认」的候选集合。研究普遍发现,LLM在长链条推理中容易「遗忘」中间状态,导致重复提问或逻辑矛盾。
这一问题与LLM的底层架构密切相关。大语言模型基于Transformer架构,通过自注意力机制处理输入序列中的所有token。虽然现代模型(如GPT-4、Claude)的上下文窗口已扩展到数万甚至数十万token,但「能放进上下文」与「能有效利用上下文」是两回事。研究表明LLM存在所谓的「中间遗忘」(Lost in the Middle)现象——模型对上下文开头和结尾的信息关注度高,对中间部分的信息提取效率显著下降。在多轮问答任务中,每一轮的问题和回答都会累积在上下文中,模型需要从这些散布的信息片段中维护一个一致的逻辑状态,这对注意力机制提出了极高要求。
贪心而非全局最优。LLM倾向于提出局部看起来合理的问题,却未必是能最大化信息增益的问题。在16张牌的场景中,如果每次只确认单张牌的某个属性,而非批量切分,就会迅速耗尽查询预算。
从「能做」到「做好」的鸿沟
这个实验的价值在于揭示了一个常被忽视的评测维度:约束下的资源规划能力。当前主流基准测试多关注单次问答的正确性,而这类多轮、有预算约束的交互任务,更贴近真实的智能体(Agent)应用场景。
智能体范式是当前AI应用的重要发展方向,代表系统包括AutoGPT、BabyAGI以及各大厂商推出的Agent框架。与传统的单轮问答不同,智能体需要在环境中持续观察、规划和执行,其核心挑战包括:目标分解(将高层目标拆解为可执行子任务)、工具调用(选择合适的外部工具)、以及资源约束下的规划(在有限步骤、时间或API调用次数内完成任务)。本文讨论的45次查询限制,正是模拟了智能体在实际部署中面临的API调用预算、延迟约束等现实限制。
一个能在45次内稳定识别16张牌的模型,意味着它具备了:
- 稳定的多轮状态记忆
- 基于信息论的最优决策倾向
- 面对约束的资源分配意识
对AI能力评测的启示
交互式推理是下一个前沿
随着AI从「一问一答」走向「自主智能体」,评测范式也需要升级。像「45比特查询识别卡牌」这样的谜题,本质上是一个微型的智能体决策环境——它有明确的目标、有限的资源、需要序列化的决策。
这类任务难以通过预训练语料「背答案」,因此能更真实地反映模型的推理泛化能力。相比传统的选择题式评测,它更接近人类工程师解决实际问题的方式。
信息论视角的评测价值:从准确率到效率比
用比特作为度量单位来设计评测任务,提供了一个优雅的量化框架。它允许我们精确计算理论最优值,进而衡量模型策略与最优解之间的差距——这个「效率比」或许比单纯的准确率更能反映模型的智能水平。
传统AI评测基准如MMLU、HumanEval、GSM8K等主要关注正确率——模型答对了多少题。但随着顶尖模型在这些基准上逐渐饱和(部分已超过人类平均水平),研究社区开始关注更细粒度的能力维度。效率比的概念借鉴了算法复杂度分析的思想:不仅看问题能否解决,还看解决问题消耗了多少资源。类似于算法中O(n)和O(n²)都能完成排序,但效率天差地别。在LLM评测中,这可以体现为:达到同样正确率所需的推理步骤数、token消耗量、或交互轮次——这些维度在实际部署中直接关系到成本和延迟,也更能区分「看起来聪明」与「真正高效」之间的差别。
结语:小谜题背后的大问题
尽管这只是 Hacker News 上一个关注度不高的帖子,但它提出的问题却颇具前瞻性。在信息受限、需要动态规划的环境中,LLM究竟表现如何?
答案可能是:理论上完全可行,但实际执行中考验的是模型被低估的短板——长程状态追踪与最优策略规划。这提醒我们,评价一个AI的智能,不能只看它知道多少,更要看它在约束条件下能否聪明地行动。
对于研究者和开发者而言,这类信息论驱动的交互谜题,值得成为衡量下一代推理模型的重要参考。
核心要点
相关推荐

Cursor Agents窗口争议:AI编程效率与开发者控制权的博弈
Cursor力推Agents窗口引发开发者不满,并行运行多个AI Agent真的能提升编码效率吗?深入分析AI编程工具中效率与控制权的矛盾,探讨Agent工作流的真实边界与隐患。

AI时代学习法:90%的知识只需理解无需死记
在AI工具普及的时代,90%的学习材料只需理解原理无需死记硬背。本文探讨如何区分需要内化的核心知识与可按需调用的信息,帮助学习者摆脱内卷式记忆堆积,转向深度理解与高效学习。

Ox Alpha疑似谷歌Gemini:匿名模型测试背后的竞争策略
AI社区热议神秘模型Ox Alpha可能出自谷歌Gemini系列。本文深度解析匿名模型测试的战略意义、行业惯例及对AI竞争格局的影响,探讨谷歌是否正以隐身方式发起强势出击。