[控场AI]
· 7 分钟阅读· 3,954 字

Jev:颠覆ChatGPT架构的超高速AI决策引擎

Jev:颠覆ChatGPT架构的超高速AI决策引擎

ChatGPT联合发明者推出决策模型Jev,宣称速度达传统大模型200倍、成本低至400分之一,用极致速度换取单点推理深度。

Jev是由ChatGPT联合发明者历时两年打造的全新AI产品,其核心架构与主流聊天模型截然不同:它不基于RLHF,而采用自研的RLCD训练方式,定位为"通用决策模型"而非对话生成器。Jev最大的卖点是极致的速度与成本优势——官方宣称最高达传统大模型200倍速、成本低至400分之一,输出token完全免费,特别适合客服路由、实时控制、NPC决策等需要海量并行判断的场景。演示视频中,Jev实时玩《毁灭战士》、维基竞速、驱动50个NPC、乃至重建特斯拉FSD逻辑,速度优势肉眼可见。另一个卖点是声称"零幻觉",但该特性本质上源于输出被约束在结构化选项集合内。其明确短板是不擅长从零写代码、深度推演和交互对话,下棋测试中棋力明显弱于ChatGPT,但因对手超时而获胜——这恰好点出了Jev的本质:以速度换深度。

一个ChatGPT联合发明者的新赌注

互联网上正在被一款名为 Jev 的全新AI刷屏,它最引人注目的特点只有一个字:快。相关推文的浏览量已逼近3000万次。发布它的人来头不小——他曾参与联合发明ChatGPT,如今却带来了一个与ChatGPT架构完全不同的产品。

据这位创始人自述,他花了两年时间处于"隐身模式",构建了一种全新的训练方式,称为 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习),用以区别于ChatGPT所依赖的RLHF(基于人类反馈的强化学习)。他抛出的核心质疑是:为什么超越人类的聊天模型至今没有带来AGI?

It is so fast.

他给出的答案是换一条路。Jev 不是聊天模型,而是一个通用决策模型。你给它任何需要做出的决策,它都能完成,而且能在几秒内并行做出成千上万个决策。官方宣称其速度最高可达传统大模型的200倍,成本最低可至400分之一——正因为输出token的成本被压到极低,他们干脆把输出token设为完全免费、无限量,输入token也只需几分之一美分。

RLHF与RLCD的区别

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是ChatGPT等主流大模型的核心对齐技术:模型生成多个候选回答,人类标注员根据主观偏好打分,再用这些评分训练一个"奖励模型",最终通过强化学习让AI尽可能地输出令人满意的答案。这套机制的优势是能让模型显得"聪明、流畅、讨喜",但批评者指出,它本质上是在优化"让人类觉得好",而非"客观正确"——当人类评分者也会犯错或产生偏见时,模型便可能学到错误的判断倾向,也就是幻觉的来源之一。

RLCD(Reinforcement Learning for Calibrated Decisions)则将优化目标从"人类满意度"切换为"决策校准度"——即模型输出的置信度与实际正确率要高度匹配,不过度自信、也不过度保守。这一思路在金融风控、医疗诊断等领域早有研究基础,核心诉求是让模型"知道自己知道什么、不知道什么",从而在关键场景中给出可信赖的结构化判断而非流畅但可能有误的文字。

决策引擎:它擅长什么,不擅长什么

Jev 的定位可以理解为一个"决策引擎":输入一个状态或一堆信息,让它做出判断,而且不是一次一个、按顺序进行,而是数百上千个决策并行输出。

一个典型示例是客服工单路由。当用户抱怨"我被重复扣款了,今天必须解决",并附带账户信息(Pro套餐、账户年龄420天)时,Jev 可以在毫秒级判断:这是什么类型的请求?是否需要紧急处理?优先级如何?它在给定选项中直接给出结论。

在基准测试中,官方展示Jev在类型安全(type safe)等指标上与Luna、Tara、Sonnet 5持平,甚至高于Opus 5,但价格只是零头。

不过创始人也坦承了取舍。Jev 不适合从零写代码,也不适合交互式的聊天对话。它的使用场景更像是"我有一个问题,或者一千个问题,请尽快回答"。团队甚至直接点名,Jev 在下棋这类需要深度推演的任务上会明显不如ChatGPT或Claude这样的聊天模型。

他们打出的口号颇具火药味——"We're building prod, not God(我们在造生产力工具,不是造神)",被解读为对Anthropic的直接喊话。

"决策模型"与"生成模型"的本质差异

主流大语言模型(LLM)本质上是自回归生成模型:每次只预测下一个token,逐字输出,天然是串行的。这种架构让它们擅长连贯推理、开放式写作和多轮对话,但单次推理延迟较高,且并行处理大量独立问题的成本随数量线性叠加。

决策模型的设计出发点不同:给定一个状态空间和有限的行动选项,模型的任务是从离散集合中选出最优动作,而非生成任意长度的自由文本。这类任务天然适合并行化——1000个相互独立的路由判断可以同时推理,而无需等待彼此的结果。这也解释了为什么Jev的输出token成本极低:它输出的往往是短小的结构化标签或动作指令(如"高优先级/退款/转人工"),而非几百字的解释性回答。这种设计取舍让它在吞吐量和延迟上获得数量级的优势,但同时也失去了处理开放式、需要长篇推演任务的能力。

零幻觉:面向关键任务的可靠性

Jev 另一个被反复强调的卖点是声称零幻觉。创始人的逻辑是:RLHF 把模型优化成迎合人类,而人类会犯错,这正是传统大模型产生幻觉的根源之一。虽然过去几年幻觉率已大幅下降,但在某些场景下任何幻觉都是灾难性的——医疗、军事目标识别、交通调度等人命关天的决策场景,容错空间几乎为零。

Now, imagine this with Zapier.

对于每秒需要做出成千上万个决策的企业而言,这种速度、成本与可靠性的组合极具吸引力。视频中提到,可以通过自动化平台(如Zapier)把邮件、客服请求等批量数据接入Jev,以极低成本和数百倍速度在工作流中完成决策。(此为视频中的赞助内容,仅作场景示意。)

"零幻觉"声明的背景与局限

"幻觉"(Hallucination)是指大模型自信地输出与事实不符的内容,这是当前所有生成式AI面临的核心挑战之一。主流评测(如TruthfulQA、HaluEval)显示,即便是最先进的模型在事实性问答上仍有数个百分点的错误率。

需要注意的是,"零幻觉"的声明通常针对特定任务形态而言——当模型的输出空间被严格限定在预定义的选项集合内(例如:路由到A部门 / B部门 / C部门,三选一),它在物理上就无法"捏造"一个不存在的选项,幻觉问题因此被结构性地规避。这与开放式文本生成中的幻觉是完全不同的语境。因此,Jev的"零幻觉"更准确的理解是:在结构化决策任务的范畴内,输出被约束在合法动作空间之中,从而避免了传统意义上的事实捏造问题——而非意味着它在所有任务上都绝对不会出错。

令人震撼的实时Demo

真正让Jev"出圈"的,是一系列几乎无法用肉眼跟上的实时演示。

实时玩《毁灭战士》(Doom):Jev 直接嵌入游戏循环,实时观察画面并做出操作决策,速度快到看起来毫无延迟。

维基竞速 (Wiki Race):让模型从一个维基页面点击跳转到目标页面。视频把Jev、Tara 5.6、Haiku 4.5、Sonnet 5四者并排对比——Jev完成三跳的速度快到肉眼几乎捕捉不到,另一轮五跳仅用半秒,而其余模型分别耗时约4秒、5秒、5秒。

All the different colors and one by one.

小镇NPC决策:作者用其他工具搭建了一个小镇场景,50个角色均由Jev驱动。发出"面包店大甩卖"的广播后,0.6秒内产生50个独立决策:39个继续原来的事、6个去查看、4个参与、1个去通知他人。换成更"激进"的提示(不去喷泉就会被毒蛇咬)时,绝大多数角色立刻涌向喷泉。

分拣15万颗Skittles:用筷子逐一挑拣、按五种颜色分入不同桶。即便调到最高速度,模型依然是并行做决策、逐颗指挥筷子该抓哪颗、放哪个桶。

社区衍生应用与国际象棋对决

Jev 发布后,社区迅速涌现出各种创意应用,佐证了它作为"决策层"的独特价值:

  • 模型路由器:Riley Brown 构建了一个模型路由器,Jev 本身不回答问题,而是判断某个提示该分发给哪个最合适、最便宜的模型。

Here's Riley Brown, who built a model router.

  • Unclutter 广告拦截器:由Kitsi推出,用Jev在几分之一秒内自动移除网页广告和垃圾内容,开源、需自带API密钥,月成本仅几美分。

  • 重建特斯拉FSD:Justin Schroeder 在不到一小时内用Jev重建了特斯拉的完全自动驾驶逻辑,车辆的前进、转向、遇停车标志停车等决策全部由Jev实时给出。

  • 实时操控《任天堂明星大乱斗》(Melee):团队成员Alex用Jev实时控制游戏角色。

关于下棋的短板也有直接对比:面对Fable,Jev在棋力上被压制,到第29步已落后16子并升变出第二个皇后;但Fable每步要花6到15秒分析,Jev仅需2.6秒。结果反而是Fable因超时被判负——这意味着在快棋(bullet chess)中,Jev可能仅凭"逼时间"就几乎每盘都能赢。这一细节恰好点出了Jev的本质:它用极致速度换取了单点决策深度。

速度即价值

Jev 代表了一种与主流聊天模型截然不同的思路——结构化、面向决策、极致快速、极致廉价。它不是万能的,从零写代码、深度对话、复杂推演都不是它的强项。但对于那些需要海量、并行、低延迟决策的场景,速度、成本与可靠性的三重优势可能打开全新的应用空间。

正如视频结尾所言,我们才刚刚开始理解如何使用它。随着越来越多的开发者上手,速度究竟能带来多大价值,答案会逐渐清晰。

分享:

相关推荐