Ollama v0.35.1发布:引入Clef决策模型与多模态能力

Ollama v0.35.1 新增 Cloudflare 决策模型 Clef 支持,并引入能力声明机制与搜索增强。
Ollama v0.35.1 的核心亮点是对 Cloudflare 开源决策模型 Clef(27B)与 Clef Flash(9B)的支持,两者通过全新的 `/v1/systemone` 接口调用,能够联合图像与文本输入返回结构化的置信度评分,适用于内容审核、意图识别等自动化判断场景。此外,本次更新在 Modelfile 中引入了 `CAPABILITY` 显式声明机制,使客户端能够准确识别模型类型,避免将决策模型误当作聊天或工具调用模型使用。功能层面,网络搜索单次上限从 3 次提升至 10 次,底层同步更新了 llama.cpp 与 MLX 引擎,进一步完善了对新模型架构和 Apple Silicon 设备的支持。整体来看,Ollama 正从单纯的本地模型运行器向更完整的本地 AI 基础设施演进。
本地大模型运行工具 Ollama 发布了 v0.35.1 版本更新。这次版本的核心亮点是对 Cloudflare 全新开源决策模型 Clef 系列的支持,同时在模型能力声明、网络搜索等方面也带来了多项改进。对于习惯在本地部署和运行 LLM 的开发者来说,这些更新进一步拓展了 Ollama 的应用场景。

Clef 决策模型:全新的多模态判断引擎
Ollama 现在支持 Cloudflare 推出的开源决策模型 Clef 与 Clef Flash,通过全新的 /v1/systemone 接口调用。其中 Clef 为 27B 参数规模,Clef Flash 为 9B 参数规模,两者都具备多模态能力——请求中可以同时包含图像与文本状态,图像由所有问题共享,并与文本一起被联合评分。
与传统对话模型不同,Clef 的设计目标是「做决策」而非生成文本。它接收一个状态(state)和一组问题(questions),并针对每个问题返回结构化的判断分数。例如官方示例中,开发者可以上传一张截图并询问「这张图里是否包含 Ollama」,模型会返回一个介于 0 到 1 之间的置信度分数:
curl http://localhost:11434/v1/systemone -d '{
"model": "clef-flash",
"state": "The user took this screenshot.",
"images": ["<base64-encoded image>"],
"questions": {
"has_ollama": {"type": "noul", "instructions": "Does this image contain Ollama?"}
}
}'
返回结果中 has_ollama 的 noul 值为 0.958,表示模型高度确信图像中包含 Ollama 相关内容。这种结构化输出的方式非常适合用于自动化判断、内容审核、意图识别等场景,能够直接接入业务逻辑而无需再对自由文本进行二次解析。
「决策模型」(Decision Model)是一类区别于生成式语言模型的专用架构,其核心目标是对给定输入输出结构化的判断结果,而非生成连续的自然语言文本。这类模型在设计上更接近分类器或评分器,输出通常是数值置信度、布尔判断或多标签打分,天然适合与程序逻辑直接对接。noul(Normalized Output Unit Likelihood 的缩写,或 Cloudflare 自定义的评分类型)即为这类结构化输出类型之一,其取值范围为 0 到 1,可直接作为业务规则的判断阈值使用,省去了对自由文本进行正则解析或二次调用模型提取结构的额外步骤。这种范式在内容安全审核、意图分类、自动化 QA 测试等工业场景中已有广泛应用,Clef 将其延伸到了本地部署的多模态场景。
CAPABILITY 声明:让模型能力更明确
本次更新在 Modelfile 中引入了 CAPABILITY 声明机制,模型创建者可以显式声明一个模型具备哪些能力。这一声明在多个环节都会被保留:从 GGUF 或 safetensors 创建模型时、通过模型继承时、以及导出 Modelfile 时都能延续。
这个改动看似细微,实际解决了一个长期存在的痛点。过去客户端往往无法准确判断某个模型究竟支持对话、工具调用还是推理(thinking)能力,只能靠猜测或试错。有了显式声明后,客户端可以根据能力标签提供更精准的交互界面。
配套地,ollama show 命令和模型列表现在对决策模型只会报告 decision 这一项能力。这意味着像 Clef 这样的决策模型不会再被客户端错误地当作通用聊天、工具调用或思考模型来调用,避免了功能误用。
网络搜索能力增强与引擎更新
除了决策模型相关的改进,这个版本还提升了模型的网络搜索上限。使用网络搜索的模型现在单次响应可以执行最多十次搜索,而此前的上限为三次。对于需要多轮检索、跨来源整合信息的复杂查询来说,这一提升能显著改善回答的完整度与准确性。
底层引擎方面,Ollama 同步更新了 llama.cpp 和 MLX 引擎。MLX 引擎的更新对 Apple Silicon 设备上的本地推理尤为重要,而 llama.cpp 的持续跟进则保证了对最新模型架构和量化格式的兼容性。
llama.cpp 是一个由 Georgi Gerganov 主导的开源 C/C++ 推理框架,专为在 CPU 及消费级硬件上高效运行大语言模型而设计,支持 GGUF 量化格式,是 Ollama 底层推理的核心组件之一。MLX 则是 Apple 专为 Apple Silicon(M 系列芯片)打造的机器学习框架,能够充分利用统一内存架构(Unified Memory)实现 CPU 与 GPU 之间的零拷贝数据共享,在 Mac 设备上运行本地模型时可获得明显优于通用方案的推理速度与能耗比。两个引擎的同步更新意味着 Ollama 能够及时跟进上游社区对新模型架构(如 Gemma 3、Qwen 3 等)的适配,以及对更激进量化格式(如 Q2_K、IQ4_XS 等)的兼容支持。
对开发者意味着什么
从 v0.35.1 的更新方向可以看出,Ollama 正在从一个单纯的「本地模型运行器」向更完整的本地 AI 基础设施演进。Clef 决策模型的引入,代表着 Ollama 开始覆盖除文本生成之外的结构化判断类任务;而 CAPABILITY 声明机制则体现了其在生态规范化上的努力。
对于正在构建本地 AI 应用的团队,决策模型提供了一种轻量、可控、隐私友好的判断工具——所有推理都在本地完成,无需将敏感数据(尤其是图像)上传到云端。结合多模态能力,这类模型在边缘设备上的内容识别、自动化流程判断等场景中具有不小的想象空间。
这是一个以功能增强为主的迭代版本,建议使用 Ollama 的开发者及时升级,以体验 Clef 系列模型并获得搜索与引擎方面的改进。
相关推荐

永生经济学:当时间不再稀缺,价值将如何重构?
SFIA 深度探讨永生经济学:当时间不再稀缺,生物永生、数字意识上传、冷冻复活如何重写劳动、财富与价值规则?从专利强制许可到意识复制的劳动力崩塌,再到意义成为新稀缺品,一场关于永生社会的硬核思想实验。

Claude存储架构大变动:本地与云端的界限正在重划
Anthropic正在调整Claude的数据存储架构。10月6日起Pro/Max新会话将仅支持云端存储,Claude Code保留本地选项,企业版存储位置仍由管理员决定。本文梳理本地与云端的最新界限及对不同用户的影响。

共同主导AI安全训练营:法律与治理从业者的实践启示
一位AI安全训练营的共同主导者分享面向法律与治理从业者的培训经验,探讨跨学科教学的挑战、概念翻译的必要性,以及AI治理人才能力建设对行业的深远意义。