Jev模型实测:快到能实时运行Doom的AI

新模型Jev号称速度快10倍、输出token免费、每百万输入仅四美分,但目前仅有单一视频来源,有待独立验证。
一段视频介绍了名为Jev的AI模型,声称其由ChatGPT核心贡献者打造,主打真实工作场景而非聊天。Jev最大的噱头在于定价结构:输出token完全免费,输入仅约每百万四美分,成本相比主流商用模型低出数百倍。速度方面,视频以"可实时运行Doom游戏"作为直观演示,指向其推理吞吐量进入了毫秒级的新区间。质量上,作者将其对标Luna、Terra及Sonnet 5等旗舰模型,称性价比极具竞争力。不过,所有信息均来自单一视频,缺乏第三方基准测试支撑,定价的长期可持续性与实际任务表现仍有待系统验证。
一个号称快10倍的AI模型
如果一个AI模型比现有产品快10倍甚至20倍,会是什么体验?一位视频作者在实测中抛出了这个问题,并把焦点对准了一个名为 Jev 的模型。据介绍,Jev 出自一位ChatGPT核心贡献者之手——视频中直接称其为"co-invented ChatGPT"的人物,这一背景本身就为模型增添了不少关注度。
与市面上大量主打对话的模型不同,视频作者强调 Jev 的定位是"面向真正的工作场景(real work),而非单纯的聊天"。这意味着它更强调执行效率、响应速度与实际任务处理能力,而不是把重心放在闲聊式交互上。

极致的速度与低到离谱的定价
Jev 最引人注目的卖点是速度与成本的组合。视频提到,这个模型"如此高效、如此快速、如此便宜,以至于官方甚至不对输出token收费"。换句话说,output token 是免费的,用户只需要为输入付费。
而输入的定价同样低得惊人——大约 每百万输入token仅四美分(four cents per million input tokens)。作者直接用"nothing(几乎等于不要钱)"来形容这个价格。对于需要大量调用API、处理海量文本或高频交互的开发者与企业来说,这样的定价结构可能带来显著的成本优势。

如果这一定价属实,它将直接冲击当前主流模型的成本模型。目前大多数商用大模型对输入和输出token都单独计费,且输出往往更贵。Jev 免费输出、极低输入价格的组合,若能在质量上站稳脚跟,无疑会对定价体系形成压力。

理解这一定价的颠覆性,需要了解当前主流大模型的计费惯例。绝大多数商用LLM API(如OpenAI、Anthropic、Google)采用"输入+输出分开计费"的模式,且输出token的单价通常是输入的3至5倍——原因在于生成(自回归解码)比读取上下文计算量更大、显存占用更高。以Claude Sonnet系列为例,输出价格约为每百万token 15美元,输入约3美元。Jev宣称输出完全免费、输入仅四美分,若属实,相当于把整体调用成本压缩了数百倍。这种定价策略在商业上通常有两种可能的解释:一是模型架构或推理优化上有根本性突破(如稀疏激活、投机解码等),使生成成本大幅降低;二是处于早期推广阶段的补贴性定价,长期可持续性存疑。对于开发者评估是否迁移工作流,区分这两种情况至关重要。
性能对标主流旗舰模型
速度和价格再诱人,最终还是要回到"够不够好用"这个问题上。视频作者给出的判断是:Jev 的质量足以对标 Luna、Terra 以及 Sonnet 5 等模型,但价格却只是它们的一小部分(a fraction of the price)。
这是一个相当激进的对标。如果一个模型能在保持接近旗舰水准的同时,把成本压缩到零头,那么它的性价比曲线将彻底改变很多人的选型逻辑。当然,这些结论目前来自单一来源的初步印象,尚需更系统的基准测试来验证。

文中提及的对标模型中,"Sonnet 5"指Anthropic的Claude Sonnet系列(属于其中高端产品线),而"Luna"与"Terra"在撰写本文时并非广为人知的主流产品名称,可能是特定平台或新兴厂商的内部命名,也可能是视频作者使用的非正式代称。这一点值得注意:当对标对象本身知名度有限时,"性能相当"的说法难以被独立验证,读者无法借助已有的公开基准测试(如MMLU、HumanEval、LMSYS Chatbot Arena等)来交叉核实。系统性的模型评测通常需要在标准数据集上进行盲测,或通过大规模用户投票(如Chatbot Arena的Elo评分体系)来形成可比较的结论,单一视频演示的说服力天然受限。
快到能实时玩Doom
为了直观展示速度,视频抛出了一个极具冲击力的例子:Jev 快到"可以实时运行 Doom(play Doom in real time)"。
用AI模型"玩"或"生成" Doom 这类经典游戏画面,本质上是对模型推理吞吐量的极限考验——它要求模型在极短时间内连续输出大量内容,才能维持游戏所需的实时帧率。能做到实时,说明其推理延迟被压到了非常低的水平。这个演示与前面提到的"免费输出token"逻辑上是自洽的:只有当生成成本足够低、速度足够快,官方才有底气不对输出收费。
"用AI跑Doom"已成为AI推理速度的一种非正式基准,背景可追溯至2024年谷歌DeepMind发布的GameNGen项目——该项目首次展示了神经网络在不依赖传统游戏引擎的情况下实时模拟Doom游戏画面,每步推理延迟需控制在33毫秒以内(对应30帧/秒)。此后,"能不能实时跑Doom"逐渐演变为社区检验模型生成速度的直观测试,原理是:Doom每帧画面需要模型根据当前状态输出大量像素或动作指令,帧率越高,对推理吞吐量(tokens per second)的要求就越苛刻。这与传统对话场景(用户可容忍数秒延迟)截然不同,是对低延迟、高吞吐能力的同步考验。因此,当一个模型声称能"实时运行Doom",实质上是在宣示其推理速度已进入毫秒级别的新区间,而非仅仅"回答问题更快"。
值得关注,但仍需实测验证
视频作者最后表示,他打算"heavily test"这个模型,甚至可能让它成为自己的"daily driver(日常主力工具)"。这种态度既表达了兴奋,也保留了审慎——毕竟目前所有亮点都还停留在演示和初步印象阶段。
对读者而言,Jev 呈现出的几个信号确实值得留意:一是模型竞争的重心正从"更强"转向"又快又便宜又够用";二是免费输出token这样的激进定价,可能预示行业成本结构的进一步下探;三是"实时Doom"这类演示,正在成为衡量推理速度的直观标尺。
不过需要提醒的是,本文所有信息均来自单一视频来源,关于对标模型的具体表现、定价的长期稳定性、以及实际任务中的可靠性,都还缺乏独立的第三方验证。在把它当成生产力工具之前,等待更多实测数据会是更稳妥的选择。
相关推荐

M5 Ultra 80核跑GLM-5.3-Flash实测:内存充裕但GPU成瓶颈
Reddit 用户实测 M5 Ultra 256GB 80核 Mac Studio 运行 GLM-5.3-Flash 的本地大模型表现:内存充裕但 GPU 算力成为明显瓶颈,并探讨 512GB 机型是否值得为 AI 推理买单。

Jev:颠覆ChatGPT架构的超高速AI决策引擎
Jev是ChatGPT联合发明者推出的全新AI决策引擎,采用RLCD架构,速度最高达传统大模型200倍、成本仅400分之一,输出token免费且声称零幻觉。本文解析其定位、优劣势与实时Demo。

意识的神经科学:大脑如何产生主观体验
意识的神经科学入门:从植物状态患者的脑成像研究,到意识的神经关联、简单问题与难题,再到全局工作空间理论、整合信息理论与预测加工三大主流理论,解析大脑如何产生主观体验。