[控场AI]
· 5 分钟阅读· 2,840 字

Aplomb 1:53亿参数决策模型,1M上下文四模态输入

Aplomb 1:53亿参数决策模型,1M上下文四模态输入

Aplomb 1是53亿参数的开放权重决策模型,主打概率化工具调用输出与1M token超长上下文,专为分层Agent系统设计。

EmpirioLabs发布的Aplomb 1是一款基于Qwen3.5-4B的53亿参数开放权重模型,将自身定位为"决策模型"而非通用对话模型。其核心差异化能力在于为工具调用的每个参数(工具选择、枚举值、布尔参数)返回置信概率,让Agent系统可对高置信度请求直接执行、低置信度请求转交更大模型,实现分层成本控制。模型支持100万token上下文与文本、图像、视频、音频四模态混合输入,官方推理运行时处理1M token文档约需3秒。在Decision Index 0.2.1上以44.86分位列4B模型第一,并在MMLU-Pro、GPQA Diamond等8项基准上领先同级。约12GB显存即可运行,采用source-available授权,年收入低于100万美元的机构内部使用免费。

EmpirioLabs 发布了一款名为 Aplomb 1 的开放权重(open-weights)决策模型。这个模型只有 53 亿参数,却主打几个颇具特色的能力:100 万 token 上下文、单次请求同时处理文本/图像/视频/音频,以及为工具调用参数返回概率值。它基于 Qwen3.5-4B Base 构建,在 4B 级别模型中登顶官方 Decision Index 榜单。

一个专门做"决策"的模型

与大多数通用对话模型不同,Aplomb 1 把自己定位为"决策模型"(decision model)。它的核心价值不在于生成流畅的长文本,而在于快速、带概率地给出判断结果——判断该调用哪个工具、该填入什么参数、输入里到底有没有答案。

官方给出的例子很能说明问题:对于"订单 B-44120 到货时屏幕有裂痕,我要退款"这样一句话,在给定三个工具的情况下,模型选择 issue_refund 的概率为 0.969,判定原因 "damaged" 的概率为 0.993,full_refund 为 true 的概率为 0.761。

这种为每个工具、每个枚举值和布尔参数都返回概率的设计,让 Agent 系统可以据此分流:对高置信度的调用直接执行,对不确定的部分再交给更大的模型处理。这是一种务实的分层架构思路,用小模型做前置判断,把昂贵的大模型留给真正的难题。

"决策模型"这一定位背后,对应的是 AI Agent 系统中一个长期存在的效率瓶颈:在一个完整的 Agent 工作流中,大量的步骤其实并不需要复杂的推理,而只是分类、路由或参数提取——例如判断用户意图属于哪个类别、从文本中提取结构化字段、确认某个条件是否成立。如果把这些步骤都交给参数量庞大的旗舰模型处理,既慢又贵。概率化输出进一步强化了这一优势:传统分类模型通常只给出一个离散结果,而 Aplomb 1 返回的置信度分布,使得下游系统可以实现"软路由"——只有当置信度低于某个阈值时,才将请求升级到更昂贵的模型,从而在成本与准确率之间动态平衡。

1M 上下文与推理速度

Aplomb 1 的上下文窗口从 Qwen3.5-4B 原生的 262K 扩展到了 100 万 token,支持文本、JSON、图像、视频、音频在同一次请求中混合输入。据官方描述,这是目前已知唯一一个能同时读取 1M token、接受四种模态输入、并为工具参数返回概率的决策模型。

更关键的是速度。官方自研推理运行时提供了一种长上下文模式,在处理 1M token 文档时约 3 秒就能给出决策,而完整读取一遍大约需要 111 秒。在长上下文测试里,模型对全部 525 个决策给出了正确答案。

对于短问题,模型端计算时间约 15 毫秒,端到端延迟约 200 毫秒。API 定价为每百万输入 token 0.02 美元,输出免费,并默认开启零数据留存(ZDR)。需要留意的是,这个 3 秒的长上下文速度来自官方 API 的推理运行时,开放权重版本则会读取每一个 token。

跑分成绩与数据披露

在 Decision Index 0.2.1 上,Aplomb 1 以官方工具跑出 44.86 分,位列已公布榜单中 4B 模型第一名。在全部 38 项基准中,它在 8 项上拿到了 5.3B 以内模型的最高分,包括 MMLU-Pro、GPQA Diamond 和 BBH 这几项含金量较高的测试。

其他成绩还包括 JevBench Hard 上 77.5% 的得分,以及在 MASSIVE 数据集 51 种语言上平均 75% 的零样本意图识别准确率。多语言能力对于面向全球部署的 Agent 系统是个加分项。

值得肯定的是,官方主动做了数据披露:训练数据包含了 WinoGrande 和 ContractNLI 这两个基准的公开训练集,而它们恰好也在 38 项索引基准之中。这意味着对这两项的成绩需要打个折扣。这种坦诚的披露态度,在当下跑分普遍存在"刷榜"质疑的环境里,反而增加了可信度。

MMLU-Pro、GPQA Diamond 和 BBH 是目前学界和业界公认难度较高的语言模型评测基准。MMLU-Pro 是 MMLU 的增强版,题目选项从四选一扩展到十选一,并引入了更多需要推理的专业题目,能更有效区分模型真实理解能力与记忆作答。GPQA Diamond 则专门针对博士级别的科学问题(物理、化学、生物),即便是领域专家也难以稳定作答,被认为是衡量模型深层推理能力的可靠标尺。BBH(BIG-Bench Hard)从 BIG-Bench 中筛选出当时主流模型表现显著低于随机基线的 23 项任务,专门考察逻辑推理、符号操作等难以通过数据记忆解决的能力。Aplomb 1 在这三项上领先同级,是其成绩含金量相对较高的主要依据。

部署门槛与授权条款

模型权重以 bf16 精度运行,参考脚本下大约只需 12 GB 显存,这意味着一张消费级显卡就能跑起来,部署门槛相当低。它基于 Qwen3.5-4B 并集成了 Qwen3-Omni-30B-A3B-Instruct 的音频编码器,两者均为 Apache-2.0 协议。

不过授权方面需要注意:Aplomb 1 采用的是 EmpirioLabs 自家的 Model License,对研究、评估、个人使用,以及年收入低于 100 万美元的公司内部使用免费。这是一种常见的"source-available"而非完全开源的授权模式,大型商业场景仍需额外沟通。

"开放权重"(open-weights)与"开源"(open-source)是两个常被混用但含义不同的概念。开源通常要求同时公开模型权重、训练代码、数据集,并允许任意使用和修改。开放权重则仅指公开模型参数文件,训练细节和数据来源可以不公开,授权条款也可以附带商业限制。Aplomb 1 的 EmpirioLabs Model License 正是这种"source-available"模式的典型——权重可以下载和本地运行,但商业用途受年收入门槛约束。这种授权结构在近两年的模型发布中越来越普遍,Llama 系列、Mistral 等均采用类似思路,开发者在将其集成进商业产品前需仔细核查授权条款。

小结:务实的小模型路线

Aplomb 1 代表了一种值得关注的产品思路——不去和巨型模型拼参数规模,而是把一个小模型打磨成特定任务(决策、工具调用、长文档判断)上的专精工具。概率化输出、超长上下文、四模态输入、低显存需求,这些特性组合在一起,对构建分层 Agent 系统的开发者相当有吸引力。

当然,作为厂商自己发布的成绩,这些跑分和速度数据还有待第三方独立验证。感兴趣的开发者可以通过 Hugging Face 下载权重,或在官方 Playground 中直接体验。

分享:

相关推荐