[控场AI]
· 6 分钟阅读· 3,411 字

Jev:只做决策的AI,为何又快又便宜到离谱

Jev:只做决策的AI,为何又快又便宜到离谱

Jev是一个只做决策的极速低价AI模型,300万次问答仅需44美元。

Jev是一款定位为"决策模型"的AI产品,与聊天机器人截然不同——它不生成文字,只回答是非题和分类问题。其核心设计理念借鉴心理学的"系统1思维":在给定状态下,并行执行多个分类判断,单次响应约100毫秒,且只按输入token计费,成本约为每十亿token 42美元,折算后约300万次问答仅需44美元。视频作者用它实时玩《Balatro》《马力欧》和《Doom》,验证了将复杂行为拆解为并行分类问题的可行性;并将其接入QEMU虚拟桌面,实现近实时的电脑操控。其他潜在应用包括邮件实时分类、agent上下文裁剪和替代自动化测试。Jev以"杰文斯悖论"命名,暗示越便宜的决策能力反而会催生更多使用场景,产品理念是"造产品而非造神"。

不是聊天机器人,而是一个"决策模型"

如果你已经对铺天盖地的聊天机器人感到疲惫,那么这个名叫 Jev 的AI也许会重新点燃你的兴趣。它不是又一个大语言模型——你没法跟它对话,没法让它给你写一段快速排序,也没法跟它讨论人生。它做的事情只有一件:做决策。

视频作者用了一个经典的比喻来解释它的工作原理——「系统1思维」。想象你在踢球,球突然朝你脸飞过来,你不会在脑子里冷静分析"我现在正在踢足球,让我定位球的速度和方向,然后评估我的选项"。你只会本能地一躲。这种快速、直觉式的判断就是系统1思维,而Jev正是为这种场景而生。

Jev只擅长做决策

它的定位非常清晰:不追求成为无所不能的"超级智能",而是把"决策"这一件事做到极致——又快、又便宜、又准。作者反复强调,这是他近来第一个真正让他兴奋的AI产品,因为它"不是把同样的东西反复炒冷饭"。

「系统1思维」来自心理学家丹尼尔·卡尼曼(Daniel Kahneman)在《思考,快与慢》中提出的双过程理论。系统1是快速、自动、无意识的认知模式,依赖直觉和模式匹配,几乎不消耗认知资源;系统2则是慢速、审慎、有意识的逻辑推理,需要主动调用注意力。传统大语言模型(LLM)在生成回复时更接近系统2——它需要逐token推理,权衡语义,输出连贯的长文本,因此天然较慢、成本较高。Jev的设计哲学是绕开这套机制,只做系统1能做的事:在给定上下文中快速输出一个分类结果,而不生成任何解释性文本。这一取舍是其速度与成本优势的根本来源。

怎么用它?给状态,问是非题

Jev的交互模型出奇地简单。你先给它一个状态(state),相当于告诉它"这个世界现在是什么样";然后你向它提出一组问题,让它做出判断。关键在于,这些问题是并行执行的,因此速度极快。

作者给出了几种问题类型:

  • 类型选择(type choice):从若干选项中选一个。比如给出状态"我在举重比赛中拉了裤子",让它在"继续拉"、"去洗澡"、"假装没事继续训练"之间选择——它以95%的置信度建议你去清理干净。
  • 打分(score):给出各选项的相对置信度,比如某选项85%的把握。
  • Newell 值:一个介于0到1之间的数值,名字来自伯努利(Bernoulli)分布的谐音。

作者用一个《任天堂明星大乱斗》的例子演示了它的实用性:状态设定为"你是大金刚,你想赢,收到了一条其他玩家的消息",然后问它两个问题——这条消息是否合适?这条消息是否有助于大金刚获胜?当消息是脏话时,它判断为"不合适、无帮助";当消息改成"击败所有对手"时,它判断为"合适、且相当有帮助"。

判断消息是否合适

这个例子背后有真实痛点。作者曾办过一场2000人共同操控四个大乱斗角色的活动,所有玩家发来的消息需要一个"很慢的agent"逐条审核是否含有不当内容,一次要花一分半钟。如果用Jev,就可以在消息到达的瞬间并行判断"这条合不合适?不合适就删掉",直接省下大段冷场时间。

便宜到什么程度:3百万次问答只要44美元

Jev最具冲击力的地方在于价格。作者展示了自己用它反复玩《Balatro》(小丑牌),几分钟内就烧掉了800万甚至上千万token,而费用几乎看不出变化。

官方声称它比某个未具名模型"快190×3倍、便宜444倍"——具体对标的模型作者也没搞清楚。但真实的账单数据更直观:那个大乱斗问题只有345个输入token,而Jev只按输入token计费。作者算了一笔账:这意味着大约可以问300万次这样的问题,总共只花44美元。折算下来是每十亿token约42美元,单次执行只需约100毫秒。

这也正是它名字的由来——Jev取自"杰文斯悖论(Jevons Paradox)":一样东西越便宜,人们用得越多,需求反而越高。当决策的边际成本趋近于零,你就敢于把它塞进过去根本不敢用AI的地方。

杰文斯悖论(Jevons Paradox)由19世纪英国经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)提出。他在研究煤炭消耗时发现,蒸汽机效率的提升并未减少煤炭总用量,反而因为使用成本降低而催生了更大规模的需求,导致总消耗量大幅上升。这一现象后来被广泛应用于能源、计算资源等领域:当某种资源的利用效率大幅提高时,整体需求往往不降反升。Jev以此命名,暗示其核心商业逻辑:当单次决策的成本从"不划算"降至"几乎免费",开发者就会把它嵌入过去根本不会考虑AI的环节,从而创造出全新的使用场景,而非仅仅替代现有方案。

能玩游戏,也能做"电脑操作"

为了展示它的实时能力,作者让Jev去玩多款游戏。它能实时打《Balatro》,会制定"凑对子缩放"这类策略、围绕策略选小丑牌,大约30%的胜率获胜(尽管作者吐槽它"死活不肯拿小丑牌"的打法让他很上头)。它还能玩《马力欧》和《毁灭战士(Doom)》。

实时截图并据此行动

Doom的玩法揭示了它的本质:它同时回答多个是非题——"该不该闪避?"(要么站着,要么躲)、"该不该开火?"(要么按住开火,要么松开)。你能看到它"按住不开火,等敌人靠近",这实际上是合理的战术判断。所有复杂行为都被拆解成一连串并行的分类问题。

真正让作者"上头"的应用场景是电脑操作(Computer Use)。他把Jev接入一个远程QEMU会话,每次请求都拉取屏幕截图,让它根据画面采取行动。他直言,如果配上一个"很笨但很便宜"的模型,速度能比传统方案快上百倍。

正处在演示之中

他还给出了另外两个方向的想象:

  • 邮件分类:邮件进来时判断"是否紧急",据此触发不同操作,实现实时归类。
  • 上下文裁剪:在把上下文喂给agent之前,先问Jev"这段和任务相关吗?不相关就丢掉",从而压缩agent的上下文。
  • 替代脆弱的自动化测试:作者调侃那些"写得一塌糊涂的playwright测试"——因为表单填写本质上也"只是一个分类问题",Jev在这类任务上表现很好。

QEMU是一款开源的硬件虚拟化模拟器,可以在宿主机上运行完整的虚拟操作系统环境。在AI自动化场景中,将模型接入QEMU远程会话意味着模型可以通过截图获取屏幕状态,再通过模拟键鼠输入执行操作,从而实现对完整桌面环境的程序化控制。这类"Computer Use"方案的瓶颈历来在于:每一步都需要将屏幕截图发送给模型进行理解,再等待模型返回指令,延迟叠加后整体速度极慢。Jev的低延迟特性(约100毫秒/次)在这里尤为关键——它可以在每一帧画面到达时立即给出"下一步做什么"的分类判断,使整个控制循环的响应速度接近实时,而非传统方案中数秒乃至数十秒的等待。

一个务实的方向:Build prod, not God

作者特别提到Jev的"宣言"——composable AI, build prod, not God(可组合的AI,造产品,而不是造神)。他借用了汽车发明初期的比喻:早期汽车带着许多马车时代的无用假设(比如给车装上遮眼罩)。同理,如今很多人硬用LLM去做决策,但决策并非LLM的强项。Jev的思路是把"决策"从大模型里拆出来,做成一个专门、可组合的模块。

这种克制反而是它最有说服力的地方。它不承诺终结宇宙,只承诺把一件小事做得极致快、极致便宜。对开发者而言,100毫秒的实时判断加上近乎白菜价的成本,意味着许多过去因"太慢太贵"而被否决的想法,现在都变得可行。

需要提醒的是,本文基于单一视频来源,且带有明显的演示与主观色彩。Jev对标的具体模型、准确率的严格基准等信息作者并未给出,实际生产环境的可靠性仍需自行验证。但作为一种AI产品形态的探索,"只做决策的便宜模型"确实提供了一个和聊天机器人截然不同的思路。

分享:

相关推荐