[控场AI]
· 9 分钟阅读· 4,707 字

Jev vs 开源GLiNER:System 1模型能否被替代?

Jev vs 开源GLiNER:System 1模型能否被替代?

Jev是面向生产的非生成式分类模型,核心价值是校准概率与极低延迟,开源GLiNER可部分平替但缺乏概率校准。

Jev是TypeSafe AI推出的"System 1"分类模型,采用双向编码器而非自回归生成架构,核心差异化能力在于输出校准概率——当模型给出0.8置信度时,其实际准确率统计上接近80%,这使AI决策可量化地集成进生产代码。Jev支持Choice、Score、Null三种输出类型,速度比GPT-5.6 Luna快10倍以上,在guardrail和工具选择任务上表现更优,但无法生成文本,并行决策上限255个。开源替代GLiNER 2.5仅7400万参数、可本地运行,部分测试甚至超过Jev,但缺乏校准概率这一关键能力。将LLM作为System 2战略教练、快速模型作为System 1执行器的分层架构,在复杂场景中得分翻倍,与Figure Robotics等工业机器人的实践高度同构。Jev的护城河存疑,但它将小型专业化模型带入大众视野,推动了神经符号系统的落地实践。

Jev是什么:一种非生成式的"System 1"模型

今年AI圈最受关注的模型之一Jev,最有意思的地方在于——它既不是LLM,也不来自OpenAI、Anthropic或DeepSeek广告,而是出自一个全新的实验室TypeSafe AI。更关键的是,它采用的架构并非过去四年AI主流所聚焦的生成式路线。

TypeSafe将Jev定义为一种"System 1模型"。这个命名源自Daniel Kahneman在《思考,快与慢》中的理论:人类有两种思维模式——缓慢的推理(System 2)和快速的直觉(System 1)。Jev对应的正是后者,用更通俗的话说,它本质上是一个超快速的分类模型(classification model)。Figure Robotics等公司也采用了类似的分层命名(System 0/1/2)。

Jev仅通过API提供服务。输入是"状态(state)"和"问题(questions)",输出则是基于状态需要做出的决策。在官方的Doom游戏演示中,Jev并不直接看游戏画面,而是通过visDoom库把游戏状态翻译成描述血量、弹药、敌人位置、道具位置的JSON对象。

自回归生成式模型与非自回归分类模型的根本区别值得在此厘清。GPT、Claude等主流LLM采用自回归架构:模型每次只预测下一个token,必须串行地、一个接一个地生成输出,天然存在延迟累积。相比之下,分类模型(classification model)的输出空间是有限且预先定义的——模型只需在已知选项上输出一个概率分布,无需逐步"生成"任何内容。这种差异导致了本质不同的速度和确定性特征:分类器的推理时间几乎与类别数量无关,而生成式模型的延迟与输出长度成正比。Jev正是利用了这一架构特性,通过将决策问题建模为分类任务,完全绕开了自回归生成的瓶颈。

三种决策类型与关键的"校准概率"

Jev允许定义三种输出对象:

  • Choice(选择型):一组无序的固定选项,Jev输出一个概率分布。
  • Score(评分型):与Choice类似但选项有顺序,比如"撤退—保持—前进—冲锋"构成一个滑动刻度,输出值会落在选项之间,体现非完全离散的特性。
  • Null(是否型):本质是yes/no,但同样落在0到1的刻度上,0.5代表模型拿不准。

真正让Jev与众不同的,是每个输出都附带校准概率(calibrated probability)。当Jev给出0.8的概率时,意味着它在这类判断上大约有80%的正确率。这为代码集成提供了可测量的信心和可解释性。

校准概率带来可测量的信心

从期望校准误差(ECE)图表可以看到,Jev的曲线非常贴近理想校准线。相比之下,GPT-5.6 Luna虽然表现不差,但它几乎总是报告极高的置信度(动辄95%);而Jev在自己可能出错时,会"诚实地"给出偏低的概率。这种特性对构建生产级pipeline意义重大——你可以明确地说"这条流程大约有80%会正确",这是LLM难以做到的。

**期望校准误差(Expected Calibration Error, ECE)**是衡量模型置信度可靠性的标准指标。其核心思想是:如果一个模型在100个不同问题上都给出了0.8的置信度,那么这100个预测中理想情况下恰好有80个应该是正确的。ECE将预测按置信度分桶,计算每个桶内"声称的置信度"与"实际准确率"之间的加权偏差。ECE越接近0,模型越"诚实"。许多大型语言模型存在系统性过度自信问题——即便在不确定领域也倾向于输出极高置信度,这使得其概率输出在统计上缺乏可操作性。校准良好的模型可以让工程师将置信度阈值直接用于控制流逻辑,例如"置信度低于0.6时转交人工审核",这在金融、医疗等高风险场景中具有实际意义。

速度优势与能力边界

Jev的另一大卖点是极致的延迟表现。在服务器端,Luna生成一个决策的时间里,Jev能输出12到14个决策。更重要的是,Jev并行处理所有决策——如果一次有10个判断要做,它们在同一时间完成,而LLM需要生成更多token、耗时更长。

在benchmark对比中,除了银行意图分类(Banking 77)这一项外,Jev基本都能匹配或超越Luna,尤其在guardrail相关任务(prompt injection、toxic检测)上明显领先。这意味着Jev在护栏和工具选择这两大当前LLM的高频用途上,经过测试验证后可以替代部分环节。

但Jev有明确的能力边界:

  • 它是分类器,无法生成文本,聊天、搜索、代码生成仍需LLM。
  • 并行决策数量上限约255个。
  • 状态上限约32,000 token,且远未到达上限前性能就会下降。

并行决策存在255个的上限

换句话说,Jev不是LLM的替代品,而是AI栈中的一个补充组件。它推动的,是把神经网络与符号逻辑(代码)结合的神经符号系统(neurosymbolic system),让快速、可预测的决策能被放心地集成进生产代码。

开源替代:GLiNER能否平替Jev?

这里出现了一个耐人寻味的矛盾:Jev是闭源专有的。TypeSafe只透露了后训练方法叫RLCD(reinforcement learning for calibrated decisions),以及它不是自回归模型——它直接从网络中拉取概率值,很可能仍是Transformer,只是换了不同的输出头。架构研究者Archie Hume的文章《Jev's architecture, amassed》对此有更深入的推测。

问题在于,Jev所做的事情,很大程度上可以用早已存在的开源模型复现。Jev发布后几天内就出现了多个"Open Jev"复制品。UP主在实测中重点推荐了Fastino AI的GLiNER 2.5。

开源模型共享双向编码器架构

GLiNER是一个模型家族,名字源自"GLiNER NER"(命名实体识别),最早的版本可追溯到2023年。GLiNER 2.5通过改变输入schema,也能完成和Jev相同结构的分类任务。它们都是双向编码器模型,缺少LLM的自回归头。

最惊人的是体积:GLiNER 2.5系列仅有7400万到3亿参数,可以在消费级硬件上流畅运行。在作者的Doom测试中,用于游戏的正是7400万参数的小模型,很多情况下甚至超过了Jev;GlyGuard在部分护栏benchmark上也优于Jev。

不过开源方案也有明显短板:GLiNER不提供校准概率,也不给出完整的概率分布——0.65的得分并不代表65%的正确率。而且不同用途需要切换不同模型(GLiNER 2.5、GlyGuard等),不像Jev一个模型通吃。这恰恰是Jev和TypeSafe最大的价值所在。

**双向编码器(Bidirectional Encoder)**与自回归解码器是Transformer架构的两种主要变体。BERT系列模型采用双向编码器:在处理输入时,每个位置可以同时"看到"左右两侧的上下文,适合理解类任务(分类、实体识别、相似度计算)。GPT系列则使用因果(单向)解码器,每个位置只能看到左侧历史,因此适合生成任务但天然不擅长分类。GLiNER和Jev均基于双向编码器思路,这正是它们能以极小参数量完成高质量分类的原因——模型不需要存储生成文本所需的巨量世界知识,只需学会在给定上下文中区分有限选项。RLCD(Reinforcement Learning for Calibrated Decisions)则是TypeSafe在后训练阶段针对概率校准专门设计的强化学习方法,使模型输出的置信度在统计意义上真正可信。

快思考与慢思考:用LLM指挥System 1

延迟方面,Jev报告的服务器时间约88毫秒一次分类;而在MacBook M4 Pro的GPU上本地运行GLiNER 2.5 small,速度快了约8倍。本地运行带来的低延迟在实时场景中至关重要。

回到Kahneman的"快与慢"框架,作者尝试组合两种系统:单独使用快速模型(GLiNER或Jev)时,模型会变得非常战术化——只会"看到就打",不会去思考拿武器、找补给。于是加入GPT-5.6 Luna作为"System 2"教练,由LLM下达更具战略性的指令("去那个房间拿等离子枪""血量低了去拿medikit"),快速模型负责执行。

LLM向快速System 1模型下达战略指令

这种分层并非孤例。Figure Robotics的Helix 2模型就明确区分了System 2(推理LLM)、System 1(快速神经网络执行指令)乃至System 0(类似人类反射的稳定控制)。

实测结果很有说服力:在Defender、Deadly Corridor这类"扣扳机"地图上,加不加LLM教练几乎没差别,LLM大多闲置。但在Deathmatch地图上,带LLM教练的GLiNER得分翻倍以上。原因在于本地GLiNER每秒能完成约8.8次决策,而托管的Jev受网络影响只有2.5次/秒——哪怕把Jev延迟减半,仍远不及本地GLiNER。

Figure Robotics的Helix 2分层架构为这种System 1/2协作提供了工业级参照。在真实机器人控制中,单纯依赖大型推理模型存在致命缺陷:网络延迟和推理时间导致机器人反应迟缓,在动态物理环境中意味着碰撞或任务失败。Helix 2的解决方案是三层分离:System 2负责长时程规划("把红色方块放到箱子里"),System 1接收指令后以毫秒级速度处理传感器输入并输出关节力矩,System 0则处理平衡和防跌倒这类需要硬实时保证的反射性控制。这种分层的核心洞见是:不同认知任务对延迟和抽象层次的要求截然不同,强行用单一模型通吃所有层次既浪费算力,又无法满足实时性约束。游戏AI与机器人控制在此呈现了高度同构的架构需求。

Jev的护城河有多深?

作者对TypeSafe的策略提出了疑问:让Jev强大的那些特质(必须快、因此必须小),恰恰让它难以构建护城河。小模型意味着开源很可能快速追平,而校准概率本身并非全新技术,只是此前开源界较少应用,迟早会被引入。

但他也肯定了Jev的意义:它把更小、更专业的模型带到大众面前,让人们意识到这类模型真正可用。如果未来智能只掌握在少数拥有海量算力的大公司手中,那将是一个"反乌托邦"的局面;而Jev抢下了这块蛋糕的一角,用一个大多数人很快能本地运行的模型做到了这一点。

无论是Jev还是GLiNER这样的开源替代,都值得在agentic工作流中占据一席之地。最清晰的切入点是护栏(guardrails),其次是工具选择(需注意涉及文本生成的场景仍得用LLM),再往后则是探索这些新模型在更广泛软件栈中的位置。

分享:

相关推荐