2026年10月3日,ollama 发布 v0.35.1 版本。本次更新围绕决策模型能力展开,重点带来了对 Clef 与 Clef Flash 两个开源决策模型的支持,并通过/v1/systemone接口提供调用能力。
除此之外,v0.35.1 还提升了使用网页搜索的模型在单次响应中的搜索次数上限,为 Modelfile 引入 CAPABILITY 声明,并调整了决策模型在模型列表与模型信息中的能力展示方式。同时,底层的 llama.cpp 与 MLX 引擎也完成更新。
一、v0.35.1 核心更新一览
ollama v0.35.1 的主要变化可以归纳为以下几项:
- 支持 Clef 与 Clef Flash 决策模型
- 新增
/v1/systemone调用入口 - 决策请求支持文本状态与图片共同输入
- 图片与文本状态会被所有问题共享,并共同评分
- 使用网页搜索的模型,单次响应最多可进行十次搜索
- Modelfile 支持 CAPABILITY 声明
- CAPABILITY 声明可在多种模型创建、继承和导出流程中保留
- 决策模型在
ollama show与模型列表中仅显示decision能力 - 更新 llama.cpp 与 MLX 引擎
本次版本的重点并不是通用聊天能力的扩展,而是对“决策模型”这一模型类型进行更明确的支持、调用和能力标识。
二、支持 Clef 与 Clef Flash 决策模型
ollama v0.35.1 现已支持 Clef 和 Clef Flash 两个开源决策模型,并通过/v1/systemone提供访问入口。
这两个模型分别为:
| 模型 | 参数规模 |
|---|---|
| Clef | 27B |
| Clef Flash | 9B |
Clef 与 Clef Flash 都属于多模态模型。也就是说,在发起请求时,不仅可以提供文本状态,也可以同时传入图片。
这一能力的关键点在于:图片不是作为某一个独立问题的附加内容存在,而是可以和文本状态一起作为共享上下文,提供给请求中的所有问题使用。
换句话说,一次请求可以包含:
- 一段文本状态
- 一张或多张图片
- 一个或多个待判断的问题
模型会基于共享的文本状态和共享图片,对每一个问题分别进行判断与评分。
这样的输入组织方式,使得同一份状态信息可以被多个问题复用,而无需针对每个问题重复传递相同的文本和图片内容。
三、通过/v1/systemone调用决策模型
v0.35.1 为 Clef 与 Clef Flash 提供了/v1/systemone接口。
示例请求如下:
curlhttp://localhost:11434/v1/systemone-d'{ "model": "clef-flash", "state": "The user took this screenshot.", "images": ["<base64-encoded image>"], "questions": { "has_ollama": {"type": "noul", "instructions": "Does this image contain Ollama?"} } }'从这个请求可以看出,/v1/systemone的请求主体主要包含以下内容:
| 字段 | 示例内容 | 作用 |
|---|---|---|
model | clef-flash | 指定要使用的决策模型 |
state | 文本描述 | 提供共享的文本状态 |
images | Base64 编码图片数组 | 提供共享图片输入 |
questions | 问题对象 | 定义一个或多个需要模型判断的问题 |
在示例中,使用的是clef-flash模型。
state字段中的文本为:
The user took this screenshot.这段内容作为请求的文本状态,用于描述当前输入的背景。
images字段接收的是图片数组,图片采用 Base64 编码形式传入:
"images":["<base64-encoded image>"]questions字段则用于描述需要模型回答的决策问题。示例中的问题名称为has_ollama,问题类型为noul,并通过instructions提供了具体判断指令:
"has_ollama":{"type":"noul","instructions":"Does this image contain Ollama?"}该问题的含义是判断图片中是否包含 Ollama。
需要注意的是,图片和文本状态都是共享输入。这意味着,若questions中包含多个问题,这些问题都可以基于同一个state和同一组images进行评分。
四、多模态状态如何参与决策
Clef 与 Clef Flash 的多模态能力,是 v0.35.1 本次更新中的重点之一。
在这个调用方式中,请求可以同时携带文本与图片:
{"state":"The user took this screenshot.","images":["<base64-encoded image>"]}文本状态用于提供语言层面的上下文信息,图片用于提供视觉层面的输入信息。
根据更新说明,图片会与文本状态一起被所有问题共享,并与文本状态共同参与评分。
这意味着,模型在处理问题时,不是只根据文本,也不是只根据图片,而是结合请求中提供的文本状态和图片状态进行判断。
以示例为例:
- 文本状态说明用户截取了一张截图
- 图片字段提供实际截图内容
- 问题要求判断图片中是否包含 Ollama
模型会将文本状态与图片共同作为判断依据,并对这一问题输出相应的分数。
这种方式特别强调“状态共享”的概念。请求中的文本状态和图片并不需要在每一个问题中重复定义,而是统一放在顶层字段中,由所有问题共同使用。
五、noul问题类型与返回分数
示例中的问题类型是noul:
"type":"noul"接口返回结果如下:
{"model":"clef-flash","answers":{"has_ollama":{"type":"noul","noul":0.958}},"usage":{"input_tokens":548,"output_tokens":0}}返回结果包含三个主要部分:
| 字段 | 说明 |
|---|---|
model | 本次请求实际使用的模型 |
answers | 各个问题对应的答案结果 |
usage | 本次请求的 token 使用信息 |
在示例响应中:
"model":"clef-flash"表明本次调用使用的是clef-flash。
answers中包含与问题名称对应的结果:
"answers":{"has_ollama":{"type":"noul","noul":0.958}}这里的has_ollama与请求中的问题名称保持一致。
返回结果中:
"type":"noul"表示该答案对应的类型仍然是noul。
同时,模型给出了:
"noul":0.958该数值是模型针对该问题输出的评分结果。
从示例可以看到,决策模型的输出重点不是生成一段自然语言回答,而是针对定义好的问题返回相应类型的评分数据。
这也与本次版本中对“决策模型”能力的定位保持一致。
六、响应中的 token 使用信息
示例响应还提供了usage字段:
"usage":{"input_tokens":548,"output_tokens":0}其中:
| 字段 | 示例值 |
|---|---|
input_tokens | 548 |
output_tokens | 0 |
该响应中输入 token 数为 548,输出 token 数为 0。
这一结果与决策模型的调用形式相对应。请求主要由文本状态、图片内容以及问题定义构成,而响应返回的是结构化的决策结果,而不是传统聊天形式的文本生成内容。
因此,示例中显示的输出 token 数为 0。
七、网页搜索次数从三次提升至十次
v0.35.1 还提高了使用网页搜索的模型在每次响应中的搜索次数上限。
此前,使用网页搜索的模型在单次响应中最多可以进行三次搜索。
更新后,这一上限提升为十次。
可以概括为:
| 能力 | 更新前 | v0.35.1 |
|---|---|---|
| 每次响应可进行的网页搜索次数 | 3 次 | 10 次 |
这意味着,使用网页搜索的模型在一次响应过程中,可执行的搜索次数从三次增加到十次。
此次调整直接改变的是单次响应内的搜索次数限制,搜索能力的上限得到提高。
八、Modelfile 新增 CAPABILITY 声明
v0.35.1 为 Modelfile 增加了 CAPABILITY 声明支持。
通过 CAPABILITY 声明,模型创建者可以明确声明一个模型具备哪些能力。
更新说明中强调,模型创建者可以通过这一声明机制,显式表达模型能够执行的功能。
这意味着,模型能力不再只能依赖默认判断或隐式推断,而是可以在 Modelfile 中进行明确声明。
CAPABILITY 的意义在于让模型能力具备更清晰的表达方式。
当一个模型具备特定能力时,模型创建者可以通过 CAPABILITY 对其进行标注;当模型不具备某些能力时,也可以避免客户端将其错误地当作支持对应功能的模型。
九、CAPABILITY 声明可在多个流程中保留
本次更新不仅新增了 CAPABILITY 声明,还明确说明这些声明能够在多个模型流程中被保留。
根据更新内容,CAPABILITY 声明可以在以下场景中继续保留:
- 从 GGUF 创建模型
- 从 safetensors 创建模型
- 模型继承
- Modelfile 导出
可以整理如下:
| 操作场景 | CAPABILITY 声明是否保留 |
|---|---|
| 从 GGUF 创建 | 保留 |
| 从 safetensors 创建 | 保留 |
| 模型继承 | 保留 |
| Modelfile 导出 | 保留 |
这意味着,能力声明不会只停留在最初的 Modelfile 定义阶段。
当模型从 GGUF 或 safetensors 创建时,CAPABILITY 声明可以被保留;当模型通过继承关系构建时,声明也可以保留;当模型被导出为 Modelfile 时,相关声明同样能够继续存在。
从模型创建、模型继承到 Modelfile 导出,能力声明具备连续性。
对于需要明确模型功能边界的场景而言,这种保留机制能够使能力信息在不同操作流程中持续存在,而不是在格式转换、继承或导出时丢失。
十、决策模型只展示decision能力
v0.35.1 还调整了决策模型的能力展示方式。
现在,ollama show和模型列表对于决策模型,只会报告decision这一项能力。
也就是说,当模型属于决策模型时,其能力展示会聚焦于:
decision而不会再让客户端将这类模型视为适用于通用聊天、工具调用或思考用途的模型。
更新说明明确指出,这一变化的目的,是避免客户端将决策模型提供给以下用途:
- 通用聊天
- 工具
- 思考
可以理解为,决策模型在能力展示层面将拥有更清晰的定位。
此前,如果客户端仅根据模型列表或模型信息中的能力判断可用用途,可能会将决策模型错误地作为聊天模型、工具模型或思考模型进行提供。
v0.35.1 通过让ollama show和模型列表仅报告decision能力,使客户端能够更准确地区分模型类型。
对于决策模型而言,其核心能力被明确标记为决策,而不是通用聊天、工具调用或思考。
十一、为什么只报告decision能力很重要
本次能力展示调整,与 Clef 和 Clef Flash 的接入形成了对应关系。
Clef 与 Clef Flash 通过/v1/systemone用于处理决策请求。其请求形式由状态、图片和问题构成,输出结果则是结构化答案与评分。
例如:
"answers":{"has_ollama":{"type":"noul","noul":0.958}}这种返回形式与一般聊天模型直接生成自然语言回答的方式不同。
因此,决策模型在模型列表和模型信息中仅显示decision能力,可以让客户端在模型选择时更准确地识别其用途。
这一变化并不是为决策模型增加通用聊天、工具或思考能力,而是明确限制客户端不要将其错误地归类到这些用途之中。
通过能力声明与能力展示,v0.35.1 对模型能做什么、客户端应如何使用模型,提供了更加明确的边界。
十二、llama.cpp 与 MLX 引擎更新
除决策模型、多模态输入、网页搜索次数和 Modelfile 能力声明外,v0.35.1 还更新了 llama.cpp 与 MLX 引擎。
本次更新说明中列出的底层变化包括:
- 更新 llama.cpp
- 更新 MLX 引擎
这两项更新属于 v0.35.1 的版本变更内容之一。
十三、v0.35.1 更新内容总结
代码地址:github.com/ollama/ollama
ollama v0.35.1 的关键变化可以再次概括为以下内容:
| 更新方向 | 具体变化 |
|---|---|
| 决策模型支持 | 支持 Clef 与 Clef Flash |
| 模型规模 | Clef 为 27B,Clef Flash 为 9B |
| 调用接口 | 通过/v1/systemone使用 |
| 多模态输入 | 支持文本状态与图片同时输入 |
| 状态共享 | 图片与文本状态由所有问题共享 |
| 联合评分 | 图片与文本状态共同参与问题评分 |
| 结构化结果 | 通过answers返回问题结果 |
| 使用统计 | 通过usage返回输入与输出 token 信息 |
| 网页搜索 | 单次响应最多十次搜索,原为三次 |
| Modelfile | 新增 CAPABILITY 声明 |
| 声明保留 | GGUF、safetensors、继承、导出流程均可保留 |
| 能力展示 | 决策模型仅报告decision能力 |
| 客户端行为 | 不再将决策模型提供给通用聊天、工具或思考用途 |
| 底层更新 | 更新 llama.cpp 与 MLX 引擎 |
整体来看,v0.35.1 的重点是让决策模型拥有更明确的调用入口、更清晰的输入形式和更准确的能力标识。
通过/v1/systemone,Clef 与 Clef Flash 可以接收文本状态、图片以及多个问题;通过共享状态与联合评分,模型可以针对问题返回结构化的决策结果;通过 CAPABILITY 声明及决策能力展示调整,模型创建者与客户端也能够更明确地区分不同模型的能力边界。
对于需要使用多模态决策模型、需要在模型定义中声明能力、需要提高单次响应网页搜索次数,或需要让客户端正确识别决策模型用途的场景,ollama v0.35.1 提供了对应更新。