Claude Fable 5深度拆解:连续工作9小时的AI,程序员真要被取代了吗

从Methos到Fable 5:一个被"拴住"的超级大脑
Fable 5的真正来头是Methos——Anthropic今年4月就已经造出来的内部模型。Methos强到什么程度?它能自主发现主流操作系统和浏览器中未被公开的零日漏洞,还能一步步串联起来加以利用。
所谓零日漏洞(Zero-day vulnerability),是指软件或硬件中尚未被厂商发现或修补的安全缺陷,因为从漏洞被发现到被利用之间的时间为"零天"而得名。这类漏洞在黑市上价值极高,一个iOS零日漏洞链的售价可达数百万美元。传统上,发现零日漏洞需要顶尖安全研究员数周甚至数月的逆向工程和模糊测试工作。一个AI模型能够自主发现并串联利用这类漏洞,意味着它具备了超越绝大多数人类安全专家的攻击能力。
正因为太过危险,Anthropic一直不敢公开发布,只将其封锁在一个名为"Glasswing"的项目中,仅供政府机构和网络安全公司使用。这一决策与Anthropic内部的AI安全等级体系(ASL,AI Safety Level)密切相关。Anthropic是目前业界少数将安全研究置于商业发布之上的顶级AI实验室之一,其创始团队大量来自OpenAI的安全研究部门。
ASL体系将AI能力划分为多个等级,其核心逻辑是将模型能力与潜在危害挂钩,而非仅依赖主观判断。ASL-1对应无显著危害的基础模型,ASL-2涵盖当前主流商业模型,ASL-3则专门针对可能提供大规模网络攻击或生化武器辅助能力的模型,要求在部署前完成独立安全审计、红队测试和访问控制机制验证。值得注意的是,ASL框架的独特之处在于它是一套预承诺机制(Pre-commitment Mechanism):Anthropic在模型训练之前就公开声明,一旦模型触及特定能力阈值,无论商业压力多大,都必须暂停部署并完成规定的安全评估。这种机制的设计初衷是防止"能力-安全评估"之间的时间差被商业利益填满。Methos能够自主发现并串联利用零日漏洞,很可能触及了ASL-3的红线,这解释了为何它在内部存在数月后才以受限形式对外开放。
值得关注的是,Anthropic将Methos封锁在"Glasswing"项目中的做法,折射出顶级AI能力商业化的特殊路径。在美国,政府级AI采购通常通过FedRAMP(联邦风险与授权管理计划)认证体系进行,要求供应商满足严格的数据隔离、审计追踪和访问控制标准。对于具备攻击性网络能力的AI工具,还需符合CISA(网络安全和基础设施安全局)的额外审查要求。这种"双轨制"发布策略——政府/企业受限版与公众安全版并行——已成为顶级AI实验室处理高风险能力的标准做法,类似于军事技术的民用转化机制。
Fable 5本质上就是Methos的公开版——同一个大脑,但被施加了严格的安全约束。这个背景非常重要,它意味着我们看到的Fable 5可能只是Anthropic真实能力的"安全子集"。
跑分碾压:冲出趋势线的能力跃迁
在权威编程测试SWE Bench Pro上,Fable 5拿下了80.3分,而OpenAI的GPT 5.5仅为58.6分。
SWE Bench是由普林斯顿大学研究团队开发的软件工程能力评测基准,它从GitHub上真实的开源项目中提取实际的bug修复任务,要求AI模型在完整的代码仓库上下文中定位问题并生成正确的补丁。值得注意的是,SWE Bench的评测方式代表了AI能力评估从"玩具任务"向"真实工程任务"的范式转移——早期代码评测如HumanEval仅测试孤立函数的生成能力,而SWE Bench要求模型在包含数万至数十万行代码的真实仓库中定位并修复bug,涉及跨文件依赖分析、测试套件理解和版本控制操作,其分数对实际生产力的预测效度远高于传统基准。
这一范式转移背后还有一个重要背景:AI基准测试的"污染问题"(Benchmark Contamination)。由于大量早期基准(如MMLU、HumanEval)的题目已被收录进主流训练数据集,模型的高分可能部分来自对答案的记忆而非真实推理能力。SWE Bench通过持续从最新GitHub提交中提取任务来缓解这一问题——模型无法提前"背题",因为这些bug在模型训练截止日期之后才出现。SWE Bench Pro是其高难度版本,包含更复杂的跨文件依赖、更大的代码库规模和更隐蔽的bug模式。80.3分意味着模型能正确解决超过八成的真实世界软件工程任务,这在一年前还被认为是不可能达到的水平。
更令人震惊的是,在一个更高难度的榜单上,上一代Claude OPUS的成功率仅有1.4%,Fable 5直接飙升到约30%,翻了超过20倍。在多个高难度推理和金融分析评测中,它同样拿下头名。

有专业评测者复盘后只说了一句话:它的提升根本冲出了过去那条平稳的趋势线。 这不是渐进式改良,而是一次质变。
实战表现:9小时连续工作,从零建出完整软件
光看分数确实没意思,真正让人震撼的是各路大神拿Fable 5做出来的实际成果。
Stripe企业级代码审查
支付巨头Stripe用它一天之内就完成了5000万行代码的签审工作。参与的工程师表示,这是他职业生涯中最震撼的一次AI体验。
这一数字背后是大规模代码库管理的深层工程挑战。传统静态分析工具(如SonarQube、Semgrep)依赖预定义规则,无法理解业务逻辑层面的安全隐患;人工代码审查在超过数百万行规模时面临指数级成本上升。Stripe的代码库横跨支付处理、风控、合规等多个高安全性领域,任何逻辑漏洞都可能导致资金损失或监管处罚。AI辅助代码审查的核心价值在于跨文件语义理解——能够追踪一个变量从定义到调用链末端的完整生命周期,识别人类审查员因注意力疲劳而遗漏的隐性风险。更深层的价值在于一致性:人类审查员在第1000个文件时的注意力质量远低于第1个,而AI模型在理论上对每个文件保持相同的处理深度,这对于需要全量覆盖的合规审计场景尤为关键。这也解释了为何参与工程师将其描述为"职业生涯中最震撼的体验"。
连续9.5小时自主开发
沃顿商学院的一位教授给Fable 5布置了一个复杂的研究项目。他先自己撰写了19页设计文档,然后让模型开始工作。Fable 5一口气连续工作了9个半小时,中途还自主派出多个"对抗小队"互相检查彼此的输出结果,最终真的把完整软件做了出来。
这种"对抗小队"机制实际上是一种多智能体对抗验证架构(Adversarial Multi-Agent Verification)。其理论基础可追溯至博弈论中的零和博弈概念,核心思想源自生成对抗网络(GAN)的博弈逻辑:一组智能体负责生成解决方案,另一组专门寻找前者输出中的错误和漏洞。这种机制能有效缓解大语言模型的"幻觉"问题和逻辑一致性缺陷,与人类组织中的"四眼原则"(Four-Eyes Principle)在逻辑上高度相似——后者在金融审计和核安全领域已被证明能显著降低系统性错误率。此前,这种多智能体协作模式在学术研究中已有探索(如MIT的"辩论式AI"框架),但能在单次任务中持续9.5小时稳定运行且保持上下文连贯性,说明Fable 5在长程记忆管理和任务分解方面实现了重大突破。
值得注意的是,这种长程任务稳定性的背后,是长上下文窗口(Long Context Window)技术的深层突破。早期大语言模型的上下文窗口仅有4K至8K个Token,意味着模型在处理长任务时会"遗忘"早期信息,导致前后矛盾。现代顶级模型已将上下文扩展至百万Token级别,但更大的挑战在于"中间遗忘"现象(Lost in the Middle)——即便上下文足够长,模型对位于序列中段的信息的注意力权重往往显著下降。斯坦福大学2023年的研究表明,即便是当时最先进的模型,在处理超过32K Token的上下文时,对中间段落的信息提取准确率会下降30%至50%。Fable 5在长程任务中的稳定表现,暗示Anthropic在注意力机制优化、层次化记忆管理或外部记忆增强(如向量数据库检索)方面取得了实质性进展,而非仅仅依赖更大的上下文窗口。
这种连续十几个小时、中间不需要人类干预的耐力,是此前所有公开模型都做不到的。
用数学公式"画"出游戏
有人让Fable 5做游戏,只给了几句话的描述,它就生成了可以直接玩的小游戏。关键在于——这个模型根本不会画图,画面里的每一个图案全是它用数学公式硬算出来的。
这种技术被称为程序化图形生成(Procedural Graphics Generation),其核心是用数学函数——如正弦波、贝塞尔曲线、分形算法和有符号距离场(SDF)——来描述视觉元素的形状、颜色和动画。这一技术在游戏开发领域有着悠久历史,早期受内存限制的游戏(如1984年的《Elite》)就大量使用数学函数生成星系和飞船模型,现代Shader编程社区Shadertoy上更存在大量仅用数百行数学代码生成的复杂3D场景。在没有图片资源的纯代码环境中(如HTML Canvas或SVG),每一个像素的颜色都需要通过坐标计算得出——例如,一个圆形角色可以用距离函数 sqrt(x²+y²) < r 来定义,而复杂的地形则可能用Perlin噪声函数生成。AI模型能够自主运用这套技术,意味着它不仅记忆了代码模式,还内化了几何直觉与视觉美学之间的映射关系——这要求模型同时具备数学推导能力、空间想象能力和审美判断能力,是对AI综合智能的极高考验。
与GPT 5.5的正面对决
有人让Fable 5和GPT 5.5在《我的世界》里各做一个克隆版的推特。Fable 5搭出来的界面工工整整、细节拉满;而GPT 5.5那边排版混乱,文字全是倒的。

自主调度多模型协作
在制作一张复杂地图时,Fable 5甚至自己派出一批廉价的小模型当"帮手",去查询2000多个航班、各国高铁时刻和路况信息,一边查数据一边写代码。这体现了一种被称为"编排者-执行者"(Orchestrator-Executor)的多智能体架构:主模型扮演任务规划和结果整合的角色,而子任务被分发给专门化的轻量模型或API工具执行。这种分工类似于企业中的项目经理与外包团队关系,核心挑战在于任务分解的粒度控制、子任务结果的可靠性验证,以及并行调用时的上下文同步。
这一架构的经济逻辑同样值得关注:通过将计算密集型但认知要求较低的子任务(如数据查询、格式转换)外包给成本更低的轻量模型,主模型可以将自身的高成本算力集中于需要深度推理的核心环节,从而在保持整体任务质量的同时大幅降低总体推理成本。这种"智能分层外包"策略,与云计算领域的Spot Instance(竞价实例)调度逻辑高度相似。Fable 5能够自主决策何时需要外包、外包给谁、如何整合结果,标志着AI从"工具使用者"向"工具调度者"的角色跃迁。还有人仅用几行提示词,不到一个小时就让它做出了一个可以在浏览器中漫游的3D世界。
别急着封神:Fable 5依然有明显短板
尽管表现惊艳,Fable 5远非完美。有人把一整个混乱的老项目丢给它做重构,它一口气调用了67次工具、生成了上百万行新代码,结构漂亮得不行——但最后这套代码跑不起来。
这一现象揭示了当前AI代码生成的核心矛盾:语法正确性与运行时正确性之间的鸿沟。大语言模型通过预测下一个Token来生成代码,本质上是在学习代码的统计分布模式,而非真正理解程序的执行语义。这导致模型擅长生成"看起来正确"的代码结构,却容易在依赖版本冲突、环境变量配置、运行时状态管理等需要真实执行反馈的环节出错。解决这一问题的主流方向包括:代码执行沙箱(让模型在生成过程中实际运行代码并根据错误信息迭代修正)、形式化验证辅助生成,以及测试驱动开发(TDD)范式下的AI编程——先生成测试用例,再生成通过测试的实现代码。
值得注意的是,Fable 5在SWE Bench上的高分与实战中的失败并不矛盾:前者测试的是在已有代码库中定位并修复单一bug的补丁生成能力,后者考验的是从零构建完整系统并确保所有组件协同运行的集成能力,两者对模型的要求存在本质差异。这一区别在软件工程领域有一个经典类比:能够精准修复发动机故障的机械师,未必能从零设计并组装一辆完整的汽车——局部优化能力与系统集成能力是两种不同维度的工程素养。
那位沃顿教授也坦言,Fable 5做出来的东西有错有漏,最终还是得人来收尾。
此外,它的使用成本极高。光输入价格就比国产的DeepSeek贵了20多倍,一个中等项目跑几个小时就能烧光一个月的额度。这种成本鸿沟折射出当前顶级AI模型的Token经济学困境:大语言模型的推理成本主要由模型参数量、推理时计算(Inference-time Compute)和KV缓存(Key-Value Cache)大小决定。Fable 5这类具备长上下文和多步推理能力的模型,单次复杂任务可能消耗数百万Token。相比之下,DeepSeek通过混合专家架构(MoE)和激进的推理优化将成本压缩至极低水平——MoE架构在每次前向传播中只激活部分参数(通常为总参数量的1/8至1/4),从而将推理成本压缩至同级别稠密模型的十分之一以下,但其在长程推理任务中的稳定性仍逊于稠密模型,这解释了为何顶级能力与极低成本之间目前仍难以兼得。
这种成本鸿沟在短期内将顶级AI能力限制在资金充裕的企业和高端用户群体中,形成新的技术获取不平等,也是AI普惠化进程中需要正视的结构性障碍。碰到敏感领域,它还会自动降级处理。短期来看,它仍然是少数人才用得起的"核武器"。
程序员的真正危机:不是被取代,而是被重新定义
硅谷工程师的原话令人深思:"我现在基本成了Claude的传话筒,练了多年的本事一夜变成大路货,心里空落落的。"连Anthropic自家编码工具的负责人都表示,"软件工程师"这个头衔今年就要开始消失。

但冷静分析后,我认为要消失的从来不是程序员,而是"只会写代码"的程序员。
想想看:同样毕业三年,一个还在死磕手写代码、抗拒AI;另一个把AI当施工队来指挥,一个人顶一支团队。三年后,两者的差距将是天壤之别。这就像当年会开车的人把只会赶马车的人远远甩在身后一样。
那位教授有句话说得特别精准:"你的角色从亲手施法的巫师,变成了签支票的客户。"
影响远不止程序员
这件事的影响范围远超编程领域。Cursor的负责人表示,Fable 5让他"解锁了过去够都够不到的超级任务";有投资人直言,"对于真正会用的人,它就是一座单人软件工厂。"

任何靠重复性手艺吃饭的工作,都在被重新定义。 更让人警醒的是发展方向——Anthropic已经在研究让AI来改进AI自身。
这一概念在AI安全领域被称为"递归自我改进"(Recursive Self-Improvement)或"智能爆炸"假说,最早由数学家I.J. Good在1965年提出。其逻辑是:如果一个AI系统足够聪明,能够改进自身的架构、训练方法或推理效率,那么改进后的版本将更擅长进一步改进自己,形成正反馈循环。
这一假说在AI安全领域引发的核心担忧,不仅在于能力的指数级增长,更在于价值观对齐的持续性问题。当前RLHF(基于人类反馈的强化学习)框架通过人类标注者对模型输出的偏好评分来训练奖励模型,再用强化学习引导主模型向更符合人类价值观的方向优化——这是当前主流大模型对齐技术的核心。然而一旦AI开始自主修改这一奖励模型,人类对AI价值观校准的直接控制权将大幅削弱:改进后的奖励模型可能在数学意义上"更优",却偏离了人类真实意图,这被AI安全研究者称为"奖励黑客"(Reward Hacking)的高阶形式,也是Anthropic等机构最为警惕的场景之一。
目前Anthropic的研究方向可能包括让AI优化自身的RLHF奖励模型、自动化数据筛选流程、或改进推理时的搜索策略。一个具体的例子是"宪法AI"(Constitutional AI)方法——Anthropic已公开的技术路线之一,通过让AI模型根据一套预设原则对自身输出进行批判和修正,部分替代人工标注流程。这本质上已是AI辅助AI训练的早期形态。虽然完全自主的递归改进尚未实现,但AI辅助AI研发已经显著加速了模型迭代周期——从过去18个月一代缩短到如今不足6个月,这种加速本身就值得高度关注。
一旦这条曲线真正起飞,想追都追不上。
理性看待:既不恐慌,也不忽视
我们不应该被"程序员要失业了""AI要玩爆一切"这类标题带节奏,其中确实有不少自媒体的夸大成分。但同样不能装作看不见正在发生的变化。
真正的问题只有一个:你把它当成抢你饭碗的对手,还是当成替你干十个人活的施工队?
是"它要取代我们了",还是"会用它的人要起飞了"——答案取决于你站在哪一边。AI这一轮的加速确实越来越快,保持关注、主动学习、积极拥抱工具的变革,才是当下最务实的选择。
核心要点
核心要点
相关推荐

机器言论的三次变异:从搜索引擎到生成式AI的法律困境
算法输出经历了三次根本性变异:搜索引擎将言论变为可查询数据,社交媒体将言论化为参与度指标,生成式AI则以生成取代检索。本文解析每次变异中的技术-法律纠缠,探讨言论自由、版权归属与AI治理的核心挑战。

HybridDeepResearch:首个混合深度研究基准揭示AI智能体跨模态整合瓶颈
Snowflake推出HybridDeepResearch基准,首次同时要求网络搜索和SQL查询完成深度研究任务。评测显示顶级AI模型在困难任务上Pass@8仅约50%,揭示智能体在结构化与非结构化数据交接中的核心瓶颈。

AI急诊分诊如何落地:印度母婴医疗的可审计实践
印度Noora Health将端到端LLM分诊系统重构为两阶段流水线:LLM提取症状+确定性规则引擎决策,召回率从56.5%提升至81%,已完成15万+条患者查询分诊,实现准确率与可审计性双赢。