Devin 集成 Fable 5.1:成本降54%,比 Opus 更便宜

Devin集成Fable 5.1并优化Fusion harness,通过缓存机制将高端AI编程能力的使用成本降低47%-54%。
AI编程助手Devin宣布集成Fable 5.1模型,并同步推出Fusion harness升级,双管齐下大幅降低使用成本。Fable级别智能的调用成本下降54%,价格已低于此前被视为高端代表的Opus模型。成本压缩的核心来源是缓存机制优化——通过复用请求中重复的上下文计算结果,避免了大量冗余算力消耗,属于结构性工程改进而非价格补贴。与此同时,升级后的Fusion harness在FrontierCode基准上能够匹配Fable 5.1的表现,成本却降低了47%。两项优化叠加,使Devin在保持前沿代码能力的同时持续压低使用门槛,对中小团队和大规模企业用户均具有实际意义。
AI 编程助手 Devin 宣布集成 Fable 5.1 模型,并同步公布了一项关键变化:Fable 级别的智能能力现在便宜了 54%,甚至比 Opus 更具成本优势。这一调整的核心来自缓存机制的优化,让高质量代码生成的门槛进一步降低。

Fable 5.1 带来了什么
对于依赖 AI 完成实际工程任务的开发者来说,模型能力与调用成本始终是两个绕不开的权衡点。Fable 5.1 在 Devin 中的落地,最直接的价值在于把这两者的关系重新校准了一次。
官方给出的说法是,Fable 级别的智能现在的成本下降了 54%。这意味着开发者在获得同等推理和代码生成质量的前提下,实际支出可以显著减少。更引人注目的是,经过这次调整后,Fable 的价格已经低于 Opus——而后者一直被视为高端模型阵营中的代表。对于长期在成本压力下选择模型的团队,这是一个值得重新评估工具链的信号。
成本下降的来源:缓存机制优化
值得关注的是,这次成本下降并非简单地通过降价或牺牲模型规模来实现,而是源于缓存策略的改变。
在大模型的实际调用中,很多请求会包含重复的上下文——比如系统提示词、项目背景、代码库结构等。这些内容如果每次都完整地重新计算,会带来巨大的算力浪费。通过更高效的缓存机制,系统可以复用已经处理过的部分,只对真正变化的内容进行计算,从而显著降低单次调用的实际成本。
这种优化方式的意义在于,它是一种"结构性"的成本节约,而不是靠补贴维持的价格战。对开发者而言,这类改进往往更可持续,也更能反映底层工程能力的进步。
这里的缓存机制在技术上通常被称为"KV Cache"(Key-Value Cache)或"Prompt Caching"。大语言模型在处理输入时,会将每个 token 转换为一系列中间计算结果(即 Key 和 Value 向量),这些结果在 Transformer 的注意力机制中被反复使用。如果两次请求共享相同的前缀内容,系统可以将上一次已计算好的 KV 向量直接复用,跳过重复的前向传播计算,从而大幅降低算力消耗。Anthropic 的 Claude 系列和 OpenAI 的 API 均已推出类似的 Prompt Caching 功能,通常可将缓存命中的 token 处理成本降低 80%-90%。对于 Devin 这类 AI 编程助手,每次任务都会携带大量固定的系统指令、代码库上下文和工具定义,缓存命中率天然较高,因此这种优化带来的实际收益比通用对话场景更为显著。
Fusion harness:更聪明也更便宜
除了模型本身,Devin 的 Fusion harness(融合调度框架)也得到了升级。
据官方描述,新的 Fusion harness 比此前更智能,同时成本更低。在 FrontierCode 这一评测基准上,它的表现已经能够匹配 Fable 5.1,而成本却降低了 47%。这说明 Devin 的优化并不局限于单一模型层,而是在调度、编排和执行的整个链路上做了系统性改进。
harness(可以理解为围绕模型的调度与工具协同层)的价值在于,它决定了模型能力能否被高效地转化为实际的工程产出。一个更聪明的 harness 意味着在相同任务下调用更少、走弯路更少,这本身就是成本优化的重要来源。当模型层与调度层的优化叠加,整体的性价比提升会更加明显。
FrontierCode 是用于衡量 AI 系统在真实软件工程任务上能力的评测基准,其设计思路与 SWE-bench 类似——后者是学术界广泛采用的开源基准,要求模型根据 GitHub Issue 自动生成能够通过测试的代码补丁。这类基准的核心价值在于,它考察的是端到端的工程交付能力,而非单纯的代码补全准确率,因此更能反映 AI 助手在实际开发流程中的表现。Devin 以 FrontierCode 作为参照来描述 Fusion harness 的升级效果,意味着其性能比较是在贴近真实任务的条件下完成的,而非依赖孤立的代码填空题。这一选择也说明,调度层(harness)的智能程度对最终基准分数有独立且可量化的贡献,并非仅由底层模型决定。
对开发者意味着什么
把这几项变化放在一起看,Devin 传递出的方向很清晰:在保持前沿代码能力的同时,持续压低使用成本。
对于个人开发者和中小团队,价格低于 Opus 的 Fable 5.1 降低了尝试高质量 AI 编程助手的门槛;对于大规模使用 AI 辅助开发的企业,54% 和 47% 这样的成本降幅在规模化调用下会转化为可观的预算节省。而缓存优化与 harness 升级这类"看不见的工程改进",往往比单纯的价格调整更能体现一个产品的长期竞争力。
需要说明的是,目前公开的信息主要集中在成本与基准表现上,关于 Fable 5.1 在具体任务上的能力边界、稳定性以及与竞品的横向对比,仍需要更多实测数据来验证。开发者在决定是否切换工具链时,建议结合自身的实际使用场景做进一步评估。
相关推荐

rag-eval:零依赖、无需API密钥的RAG评测工具
rag-eval 是一款零依赖、框架无关的开源RAG管线评测工具,支持本地免费的词法与检索指标,无需API密钥,并可选启用LLM Judge做语义验证,兼容Haystack、LangChain、LlamaIndex。

Vercel AI SDK 发布 workflow-harness 1.0.115 补丁更新
Vercel AI SDK 开源仓库发布 @ai-sdk/workflow-harness 1.0.115 补丁版本,同步升级 @ai-sdk/harness 依赖。本文解析该更新内容、发布机制与对开发者的意义。

用AI视频生成3D高斯泼溅模型:Minimax+COLMAP实战教程
一份实用教程:如何用AI视频生成工具Minimax拍摄360度环绕镜头,配合开源工具COLMAP进行相机位姿估计,最终生成高斯泼溅3D模型。含完整提示词、COLMAP参数设置与关键操作细节。