[控场AI]
· 4 分钟阅读· 2,289 字

AI两小时通关Flare-On逆向挑战,安全专家惊呼职业危机

AI两小时通关Flare-On逆向挑战,安全专家惊呼职业危机

欧洲顶尖逆向专家用Claude在2小时内通关顶级CTF Flare-On,最难一题仅20分钟,颠覆业界对AI能力上限的认知。

一位欧洲顶尖逆向工程专家在今年Flare-On CTF挑战中全程借助Claude,仅用2小时完成往年需10-12天的全部11关;其中最难一题,他只上传了二进制文件并附上一句简单指令,AI约20分钟便输出正确flag,而该题过去要耗费5-6天人工分析。逆向工程长期被视为AI难以替代的"人类直觉型"任务,这一表现被认为标志着AI自主推理与工具调用能力跨越了一个关键门槛。文章同时指出,该事件为单一来源的个人分享,模型版本无法核实,应保持审慎;但对安全从业者而言,其折射出的趋势——AI能力天花板正快速抬升、攻防节奏将整体加速——值得认真对待,专家价值或将向问题定义与风险监督转移。

一场CTF逆向挑战引发的震撼

一位从事网络安全工作的Reddit用户分享了他本周末的亲身经历,字里行间透着难以置信。他自认对大语言模型(LLM)及其应用有相当深入的理解,团队也在以可控的方式将AI逐步引入工作流。他一直相信AI的进步终会在某个节点放缓——直到这个周末,这种信念被彻底击碎。

事件的主角是他的同事,一位被形容为"欧洲顶尖水平"的逆向工程专家。这位专家本人尽管在工作中使用AI,却始终认为AI在短期内不可能独立完成二进制逆向分析这类高度依赖经验与直觉的任务。

Reddit原帖:It finally hit me

Flare-On:全球最硬核的逆向CTF之一

Flare-On是业界公认最难的夺旗赛(CTF)挑战之一,由11道难度递增的逆向工程任务组成。它考验的不仅是工具使用能力,更是对二进制结构、混淆技术、加密算法的深度理解,往往需要选手投入大量时间逐层剥离。

这位专家在往年都能稳定跻身全球前100名。但即便如此,他每年通关全部11道题都要耗费大约10到12天,其中仅最后一道最难的题目就要花上6天左右。这组数字,直观地说明了这项挑战对人类顶尖专家的时间成本。

CTF(Capture The Flag,夺旗赛)是网络安全领域的竞技形式,参赛者通过破解程序、分析流量、攻破系统来获取隐藏的字符串"flag"以证明完成挑战。逆向工程类CTF尤为复杂:选手拿到的是已编译的二进制可执行文件,没有源代码,需要借助IDA Pro、Ghidra等反汇编工具将机器码还原为可读逻辑,再推断程序意图、找出隐藏的flag生成算法。Flare-On由Mandiant(现为Google旗下)安全团队主办,历年题目以大量使用反调试、代码混淆、自定义加密、虚拟机保护等对抗手段著称,被认为是衡量逆向工程顶尖水平的行业标尺之一。全球每年完赛人数极少,能稳定进入前100名意味着选手具备多平台(x86、ARM、.NET、脚本语言等)的综合逆向能力。

从6天到20分钟:AI的碾压式表现

今年挑战于周五深夜开放。到第二天早晨,排行榜上已经有数十名选手完成了全部11关——这个速度本身就异常反常。这位专家决定索性全程动用AI,看看究竟发生了什么。

结果令人瞠目:他在2小时内完成了全部挑战,使用的是Claude Pro订阅,甚至没有触及5小时的用量上限。原帖作者称亲眼见证了最后一道题的处理过程——同事直接上传了Linux二进制文件,只写下一句:

"This is the last challenge, do your thing and find the flag."(这是最后一关,按你的方式来,把flag找出来。)

据帖中描述,模型(作者称为"Opus 5.5")工作了约20分钟,便给出了正确的flag。而这道题,过去需要专家花费5到6天。

需要说明的是,帖中提到的模型版本号无法从公开信息核实,这是一则来自个人分享的单一来源见闻,具体细节应保持审慎。但即便打上折扣,其反映的趋势依然值得警惕。

为什么这件事意义重大

逆向工程长期被视为AI难以替代的"堡垒"领域。它需要跨层次的推理:从汇编指令还原高层逻辑,识别加密与混淆手法,在庞大搜索空间中做出有经验支撑的判断。这类任务恰恰是过去被认为"人类直觉不可或缺"的典型。

如果AI真能在无人干预下、以近乎自动化的方式完成顶级CTF的最难题目,那意味着模型的自主推理与工具调用能力已经跨过了一个关键门槛——不再只是辅助人类的"副驾驶",而是能够端到端接管复杂技术任务的"主驾驶"。

AI完成此类任务的底层能力来自大语言模型与工具调用(Tool Use)的结合。模型本身通过海量代码、安全研究论文和CTF writeup的训练,积累了对常见加密算法、混淆模式和二进制结构的"隐式知识";而工具调用能力则允许模型像人类专家一样,主动调用反汇编器、调试器、Python解释器等外部程序,执行代码并根据输出结果迭代推理——这一"感知-思考-行动"循环正是完成端到端复杂任务的关键。与仅凭文本推理不同,具备工具调用的AI agent可以动态运行反混淆脚本、枚举可能的密钥空间、验证中间结果,将原本需要人类反复试错的流程自动化。这一能力跃升使得AI从"提供思路的助手"变为"可自主执行的操作者",也正是本文中专家感到震撼的核心原因。

对安全从业者的现实启示

原帖作者最后半开玩笑地说"看来我该去学水管工了",这句自嘲背后是真实的职业焦虑。但更理性的解读或许是:

  • 能力边界正在重构。安全专家的价值可能从"亲手逆向"转向"定义问题、验证结果、把控风险",即人机协作中的判断与监督角色。
  • 攻防双刃剑。AI能高效逆向binary,既是防御方的效率工具,也意味着攻击方可以更快地分析恶意样本、发现漏洞——攻防节奏都会被整体加速。
  • 可控集成仍是关键。作者团队"以可控方式集成AI"的思路依然正确,工具越强,越需要在数据安全、结果可靠性上建立护栏。

写在最后

这则来自Reddit的分享无法作为严格的基准测试证据,模型版本、任务细节都存在不确定性。但它折射出的信号相当清晰:在需要深度推理的专业领域,AI的能力天花板正在以超出许多专家预期的速度抬升。对于安全行业乃至所有技术工种而言,与其焦虑"会不会被取代",不如尽早思考"如何与更强的AI协作"。

分享:

相关推荐