[控场AI]
· 4 分钟阅读· 2,314 字

AI破解图灵未竟难题:Astra与Opus的密码学突破

AI破解图灵未竟难题:Astra与Opus的密码学突破

Astra与Opus等前沿AI模型据报完成了图灵二战时期未竟的密码破译工作,标志着AI能力评估从"像人"转向"解硬题"。

文章围绕一则报道展开:Anthropic旗下的Astra和Opus等前沿AI模型,据称正在破解图灵当年在布莱切利园未能彻底攻克的历史密码文本。作者将此称为"图灵的另一项测试",以区别于广为人知的图灵测试——后者考验机器能否在对话中冒充人类,而密码破译则要求真实的数学推理、模式识别与搜索优化能力,结果有明确的客观标准,无法蒙混过关。文章认为这一进展在技术史和AI能力评估两个层面均具重要意义:它构成了从图灵时代到现代AI的历史闭环,同时也反映出业界正在从主观的"是否像人"转向客观的"能否解决硬问题"这一评估范式转变。作者同时保持审慎,指出原始报道缺乏具体方法与独立验证细节,提醒读者将此视为值得关注的方向标而非已成定论的里程碑。

前沿模型接手图灵的战时遗产

八十多年前,阿兰·图灵在布莱切利园领导团队破译了纳粹的Enigma密码,为二战盟军胜利立下汗马功劳。如今,这段历史迎来了一个耐人寻味的续章:据这篇报道称,Astra和Opus等前沿AI模型正在完成图灵当年未能彻底攻克的密码学工作。

如果说"图灵测试"衡量的是机器能否在对话中假装成人类,那么这次挑战则指向图灵本人的另一项事业——密码破译。报道将其称为"图灵的另一项测试"(Turing's other test),暗示这不是关于模仿人类语言的能力,而是关于机器能否在纯粹的逻辑与计算推理领域,接续甚至超越这位计算机科学奠基人的工作。

Astra and Opus just passed Turing's other test

Enigma是纳粹德国在二战期间使用的机电式转子密码机,其核心机制是通过多个可旋转的字母转子、插线板和反射器的组合,将明文字母逐一替换为密文。由于转子每加密一个字母就会转动一格,每次击键的替换规则都在变化,理论密钥空间高达10的23次方量级,依靠手工穷举几乎不可能破解。图灵在布莱切利园的关键贡献,是改进了波兰密码学家的"炸弹机"(Bombe),设计出一种机电计算装置,能够利用已知明文片段("脆弱点")快速排除大量无效密钥,将破译时间压缩至实用范围。然而,部分更高级的德军密码系统(如Lorenz cipher,即"图灵鱼")以及战后被封存的部分文本,并未在当时被彻底破解。正是这批历史遗留的密码文本,构成了当前AI挑战的对象。

从对话模仿到硬核推理

值得深入思考的是这两种"测试"的本质区别。传统图灵测试关注的是表象层面的智能——机器能否让人相信它是人类。而密码破译则要求实打实的数学推理、模式识别和暴力搜索优化能力,没有任何蒙混过关的空间。破解成功与否有明确的客观标准。

这也解释了为什么这类成果如此引人注目。当代大语言模型常被批评为"随机鹦鹉"——擅长生成看似合理的文本,却缺乏真正的逻辑推理。而如果Astra和Opus真能在密码学难题上取得实质进展,那意味着这些模型的推理能力已经跨越了单纯的语言模仿,进入了需要严密逻辑链条的领域。

"随机鹦鹉"(Stochastic Parrot)这一批评来自2021年Emily Bender等研究者发表的论文《On the Dangers of Stochastic Parrots》,核心论点是大语言模型本质上只是在统计意义上拼接训练语料中的语言片段,并不具备对语言符号背后语义的真正理解,更遑论抽象推理。这一批评在学界引发了持续争论。支持者认为,模型在数学推理、代码生成和逻辑谜题上的表现仍然高度依赖训练数据中的相似模式,一旦题目措辞稍作改变,准确率便大幅下滑。反驳者则援引模型在奥林匹克数学题、蛋白质结构预测辅助等领域的进展,认为这已超出单纯的模式复现。密码破译任务的特殊价值在于:其"正确答案"在训练数据中极不可能出现,若模型能够成功破译,将为"模型确实具备某种形式的符号推理"这一立场提供更有说服力的证据。

历史与技术的双重意义

这一进展的象征意义不容忽视。图灵是现代计算和人工智能理论的共同奠基人,他既定义了可计算性的边界,也提出了机器智能的判定标准。让以他名字命名的智能测试的精神继承者——现代AI——去完成他当年因技术条件限制而未能完成的密码工作,构成了一种技术史上的闭环。

从技术角度看,破译历史密码文本是检验AI推理能力的绝佳基准。这类任务通常拥有明确的正确答案、庞大的搜索空间以及可验证的中间步骤,非常适合用来评估模型是否具备真正的问题求解能力,而非仅仅依赖训练数据中的模式匹配。

需要保持的审慎

必须指出,仅凭当前提供的素材,我们尚无法确认这项成果的具体细节:Astra和Opus究竟破译了哪些密码文本?采用了怎样的方法?破译结果是否经过独立验证?这些关键信息在原始报道中并未充分展开。

对于任何声称AI取得重大科学突破的说法,学界和业界都应保持应有的审慎。密码破译成果需要严格的可复现性验证,尤其是当它涉及历史遗留难题时。在缺乏更多技术细节的情况下,我们更应把这则消息视为一个值得关注的方向标,而非已成定论的里程碑。

对AI能力评估的启示

无论具体成果如何,这一事件反映出AI能力评估范式正在发生转变。业界正逐渐从主观的"是否像人"转向客观的"能否解决硬问题"。密码破译、数学证明、代码优化这类有明确验证标准的任务,正成为衡量前沿模型真实能力的新标尺。

从图灵测试到"图灵的另一项测试",这个转变本身或许比任何单一破译成果都更有价值——它提醒我们,评判机器智能的最佳方式,可能不是看它能否骗过我们,而是看它能否真正解决我们解决不了的难题。

当前AI评估领域正在兴起一批以"硬验证"为核心的基准测试,以弥补传统语言基准(如MMLU、HellaSwag)对推理能力评估的不足。典型例子包括:FrontierMath(由职业数学家设计的未发表竞赛题)、SWE-bench(真实软件工程缺陷修复)、ARC-AGI(需要从极少示例中归纳抽象规则)等。这些基准的共同特点是:答案可被程序或专家明确验证、题目不太可能出现在公开训练数据中、解题过程需要多步推理而非单步检索。历史密码破译与这一趋势高度契合——它天然具备客观验证标准,且原始密文本身就是一种"防数据污染"的保障,因为正确明文在破译之前根本不存在于互联网上。这使其成为评估AI真实推理边界的独特场景。

分享:

相关推荐