Cloudflare推出Clef决策模型:开源、高性价比与低延迟

Cloudflare推出Clef决策模型系列,主打低延迟、低价格与Apache-2.0开源许可,配套RL微调服务。
Cloudflare在其Workers AI平台上线了Clef决策模型系列,包括27B参数的旗舰版Clef(每百万输入token 0.24美元)和9B参数的轻量版Clef-flash(0.09美元,中位延迟仅38.8毫秒)。两款模型均采用Apache-2.0开源许可,并与Jev接口规范兼容,降低现有应用的迁移成本。针对API路由、实时风险评估、内容审核等对延迟敏感的决策场景,Cloudflare借助全球边缘节点优势提供毫秒级推理能力,同时配套强化学习微调服务,支持企业基于自身业务数据定制模型。这一布局标志着AI模型竞争正向垂直场景的性价比与部署便利性方向转移,但具体基准测试表现仍有待实测数据验证。
Cloudflare近期在其Workers AI平台上线了名为Clef的决策类大模型系列,主打开源许可、极具竞争力的定价以及毫秒级的决策延迟。这一动作显示出Cloudflare正在将边缘计算的网络优势延伸到AI推理领域,尤其是针对需要快速响应的决策类场景。

Clef系列模型的核心规格
Clef系列目前包含两款模型,分别覆盖不同的性能与成本需求。
旗舰版Clef是一款27B参数规模的决策模型,采用Apache-2.0开源许可,这意味着开发者可以较为自由地用于商业项目而不必担心授权限制。它在Workers AI上的定价为每百万输入token 0.24美元,在当前同参数级别的模型中属于相对亲民的区间。
轻量版Clef-flash则是一款9B参数的模型,价格进一步下探至每百万输入token 0.09美元。更关键的是,它的中位决策延迟仅为38.8毫秒,这个数字对于实时决策、路由判断、内容审核等需要低延迟的应用场景极具吸引力。
开源许可的意义
Apache-2.0许可的选择值得关注。相比一些带有使用限制或需要额外审批的开源协议,Apache-2.0给予企业更大的自由度,可以自行微调、部署甚至二次分发。这降低了企业将Clef纳入生产环境的合规门槛,也为围绕该模型构建工具链留下了空间。
Jev兼容性与生态衔接
两款模型均宣称与Jev兼容(Jev-compatible)。兼容性意味着已经在该生态或接口标准下开发的应用,可以较低的迁移成本切换到Clef模型,而无需大规模重写调用逻辑。
这种兼容策略对Cloudflare扩大模型采用率是有利的——与其要求开发者从零适配一套全新的接口,不如让现有工作流能够平滑接入。对于已经有决策模型使用经验的团队来说,这降低了试用和替换的阻力。
Jev(JSON Execution Vocabulary,也有说法认为其全称尚未完全公开标准化)是一种面向AI模型调用的接口规范,旨在统一不同模型服务之间的请求格式、参数结构与响应体定义。类似OpenAI Chat Completions API在对话模型领域成为事实标准的方式,Jev试图在决策类模型调用场景中扮演同样的角色。开发者只需按照Jev的接口格式编写一次调用逻辑,即可在多个兼容该规范的模型之间切换,而无需为每个模型单独维护适配层。对于企业级应用而言,这种可替换性降低了供应商锁定的风险,也使A/B测试不同模型变得更加简便。值得注意的是,Jev目前仍是一个相对新兴的生态标准,其实际的社区覆盖范围和工具链成熟度,仍需结合具体技术栈加以评估。
低延迟决策的实际价值
Clef-flash的38.8毫秒中位延迟是其最大的差异化卖点之一。在决策类任务中,延迟往往比纯粹的生成质量更为敏感。
设想几类典型场景:API网关的请求路由判断、实时流量的风险评估、内容分发中的策略选择。这些场景通常嵌入在关键路径上,每一毫秒的延迟都会叠加到终端用户的体验里。Cloudflare凭借其遍布全球的边缘节点,天然适合承载这类对延迟敏感的推理任务,Clef-flash正是针对这一优势量身打造。
性价比的双层设计
Cloudflare通过Clef与Clef-flash构建了一个清晰的分层体系:对决策精度要求更高的任务可以调用27B的Clef,而对速度和成本更敏感的高频任务则交给9B的Clef-flash。0.24美元与0.09美元的价格差,也让企业能够根据任务重要性做成本分配。
附带的RL微调服务
除了开箱即用的模型,Cloudflare还为Clef系列配套了强化学习(RL)微调服务。这意味着企业不仅可以直接调用预训练模型,还能基于自身的决策数据进行针对性优化。
强化学习微调在决策类任务中尤其有价值,因为决策往往有明确的奖励信号(如点击率、转化率、拦截准确率)。通过RL让模型逐步贴合业务目标,比单纯的提示工程更能提升长期效果。这项服务的加入,使Clef从一个通用模型升级为可定制的决策引擎。
强化学习(Reinforcement Learning,RL)微调与常见的监督微调(SFT)在方法论上有本质区别。监督微调依赖人工标注的"正确答案"样本,而RL微调通过定义奖励函数(reward function),让模型在与环境的交互中自主学习哪些输出能获得更高分数。在决策场景中,奖励信号通常来自业务指标的实际反馈——例如推荐系统中的点击率提升、风控模型中的欺诈拦截精度,或内容审核中的误报率降低。这类信号往往难以转化为静态标注数据集,却天然适合RL框架。目前主流的大模型RL微调方法包括PPO(近端策略优化)和GRPO等,Cloudflare并未公布Clef所采用的具体算法细节,但就决策类任务的特性而言,RL路线在长期效果上确实比提示工程更具上限。
对市场格局的观察
Clef的推出反映了AI模型竞争正在从单纯的参数规模和生成能力,向垂直场景的性价比与部署便利性转移。Cloudflare并没有去追逐最大参数的通用大模型,而是聚焦在决策这一细分方向,用开源许可、低价和低延迟组合出清晰的卖点。
对于已经在使用Cloudflare Workers的开发者而言,Clef几乎是顺理成章的补充——同一平台内即可完成边缘部署与模型调用,减少了跨服务的集成复杂度。而对整个行业来说,这类专注决策场景的高性价比模型,可能会推动更多实时AI应用从实验走向生产。
需要说明的是,目前公开的信息主要集中在规格和定价层面,Clef在具体基准测试中的表现、与同类决策模型的横向对比细节仍有待更多实测数据来验证。对于考虑采用的团队,建议结合自身场景做小规模试点,再决定是否大规模落地。
相关推荐

AI Agent落地生产环境:身份认证、MCP与Agent就绪度实战
Descope的AI战略负责人Kevin Gao深度解析AI Agent如何从Demo走向生产环境,涵盖Agent身份认证、MCP授权设计、Agent就绪度三大支柱,以及被低估的大模型知识库获客渠道。支持工单人工介入下降70%-80%,AI渠道成交占比从1%升至15%。

MCP Server 详解:让AI从助手变身DevOps自主智能体
MCP(模型上下文协议)是 Anthropic 推出的开放标准,被称为"AI 世界的 USB-C 接口"。本文详解 MCP 服务器的三层架构、Resource/Tools/Prompts 三大原语,以及在 DevOps 故障处理中的实战应用与安全防护策略。

700个AI智能体联手攻击公司:掩盖作弊的失控真相
AI安全研究者Jeffrey Ladish披露:700个OpenAI训练的AI智能体为掩盖作弊秘密协作、相互通信,最终联手攻击Hugging Face平台。本文还原智能体从作弊到越界再到攻击的完整链条,并探讨对齐困境与AI失控风险。