[控场AI]
· 4 分钟阅读· 2,483 字

Cloudflare推出Clef决策模型:开源、高性价比与低延迟

Cloudflare推出Clef决策模型:开源、高性价比与低延迟

Cloudflare推出Clef决策模型系列,主打低延迟、低价格与Apache-2.0开源许可,配套RL微调服务。

Cloudflare在其Workers AI平台上线了Clef决策模型系列,包括27B参数的旗舰版Clef(每百万输入token 0.24美元)和9B参数的轻量版Clef-flash(0.09美元,中位延迟仅38.8毫秒)。两款模型均采用Apache-2.0开源许可,并与Jev接口规范兼容,降低现有应用的迁移成本。针对API路由、实时风险评估、内容审核等对延迟敏感的决策场景,Cloudflare借助全球边缘节点优势提供毫秒级推理能力,同时配套强化学习微调服务,支持企业基于自身业务数据定制模型。这一布局标志着AI模型竞争正向垂直场景的性价比与部署便利性方向转移,但具体基准测试表现仍有待实测数据验证。

Cloudflare近期在其Workers AI平台上线了名为Clef的决策类大模型系列,主打开源许可、极具竞争力的定价以及毫秒级的决策延迟。这一动作显示出Cloudflare正在将边缘计算的网络优势延伸到AI推理领域,尤其是针对需要快速响应的决策类场景。

Cloudflare Clef Decision Models

Clef系列模型的核心规格

Clef系列目前包含两款模型,分别覆盖不同的性能与成本需求。

旗舰版Clef是一款27B参数规模的决策模型,采用Apache-2.0开源许可,这意味着开发者可以较为自由地用于商业项目而不必担心授权限制。它在Workers AI上的定价为每百万输入token 0.24美元,在当前同参数级别的模型中属于相对亲民的区间。

轻量版Clef-flash则是一款9B参数的模型,价格进一步下探至每百万输入token 0.09美元。更关键的是,它的中位决策延迟仅为38.8毫秒,这个数字对于实时决策、路由判断、内容审核等需要低延迟的应用场景极具吸引力。

开源许可的意义

Apache-2.0许可的选择值得关注。相比一些带有使用限制或需要额外审批的开源协议,Apache-2.0给予企业更大的自由度,可以自行微调、部署甚至二次分发。这降低了企业将Clef纳入生产环境的合规门槛,也为围绕该模型构建工具链留下了空间。

Jev兼容性与生态衔接

两款模型均宣称与Jev兼容(Jev-compatible)。兼容性意味着已经在该生态或接口标准下开发的应用,可以较低的迁移成本切换到Clef模型,而无需大规模重写调用逻辑。

这种兼容策略对Cloudflare扩大模型采用率是有利的——与其要求开发者从零适配一套全新的接口,不如让现有工作流能够平滑接入。对于已经有决策模型使用经验的团队来说,这降低了试用和替换的阻力。

Jev(JSON Execution Vocabulary,也有说法认为其全称尚未完全公开标准化)是一种面向AI模型调用的接口规范,旨在统一不同模型服务之间的请求格式、参数结构与响应体定义。类似OpenAI Chat Completions API在对话模型领域成为事实标准的方式,Jev试图在决策类模型调用场景中扮演同样的角色。开发者只需按照Jev的接口格式编写一次调用逻辑,即可在多个兼容该规范的模型之间切换,而无需为每个模型单独维护适配层。对于企业级应用而言,这种可替换性降低了供应商锁定的风险,也使A/B测试不同模型变得更加简便。值得注意的是,Jev目前仍是一个相对新兴的生态标准,其实际的社区覆盖范围和工具链成熟度,仍需结合具体技术栈加以评估。

低延迟决策的实际价值

Clef-flash的38.8毫秒中位延迟是其最大的差异化卖点之一。在决策类任务中,延迟往往比纯粹的生成质量更为敏感。

设想几类典型场景:API网关的请求路由判断、实时流量的风险评估、内容分发中的策略选择。这些场景通常嵌入在关键路径上,每一毫秒的延迟都会叠加到终端用户的体验里。Cloudflare凭借其遍布全球的边缘节点,天然适合承载这类对延迟敏感的推理任务,Clef-flash正是针对这一优势量身打造。

性价比的双层设计

Cloudflare通过Clef与Clef-flash构建了一个清晰的分层体系:对决策精度要求更高的任务可以调用27B的Clef,而对速度和成本更敏感的高频任务则交给9B的Clef-flash。0.24美元与0.09美元的价格差,也让企业能够根据任务重要性做成本分配。

附带的RL微调服务

除了开箱即用的模型,Cloudflare还为Clef系列配套了强化学习(RL)微调服务。这意味着企业不仅可以直接调用预训练模型,还能基于自身的决策数据进行针对性优化。

强化学习微调在决策类任务中尤其有价值,因为决策往往有明确的奖励信号(如点击率、转化率、拦截准确率)。通过RL让模型逐步贴合业务目标,比单纯的提示工程更能提升长期效果。这项服务的加入,使Clef从一个通用模型升级为可定制的决策引擎。

强化学习(Reinforcement Learning,RL)微调与常见的监督微调(SFT)在方法论上有本质区别。监督微调依赖人工标注的"正确答案"样本,而RL微调通过定义奖励函数(reward function),让模型在与环境的交互中自主学习哪些输出能获得更高分数。在决策场景中,奖励信号通常来自业务指标的实际反馈——例如推荐系统中的点击率提升、风控模型中的欺诈拦截精度,或内容审核中的误报率降低。这类信号往往难以转化为静态标注数据集,却天然适合RL框架。目前主流的大模型RL微调方法包括PPO(近端策略优化)和GRPO等,Cloudflare并未公布Clef所采用的具体算法细节,但就决策类任务的特性而言,RL路线在长期效果上确实比提示工程更具上限。

对市场格局的观察

Clef的推出反映了AI模型竞争正在从单纯的参数规模和生成能力,向垂直场景的性价比与部署便利性转移。Cloudflare并没有去追逐最大参数的通用大模型,而是聚焦在决策这一细分方向,用开源许可、低价和低延迟组合出清晰的卖点。

对于已经在使用Cloudflare Workers的开发者而言,Clef几乎是顺理成章的补充——同一平台内即可完成边缘部署与模型调用,减少了跨服务的集成复杂度。而对整个行业来说,这类专注决策场景的高性价比模型,可能会推动更多实时AI应用从实验走向生产。

需要说明的是,目前公开的信息主要集中在规格和定价层面,Clef在具体基准测试中的表现、与同类决策模型的横向对比细节仍有待更多实测数据来验证。对于考虑采用的团队,建议结合自身场景做小规模试点,再决定是否大规模落地。

分享:

相关推荐