测试Jev决策模型:System 1 AI在在线学习环境中的表现与改进

开发者实验揭示System 1决策模型的失败模式,并提出"预测与分配分离"的改进路径。
一位Reddit开发者通过四动作六十四轮的在线学习游戏,评估了TypeSafe的Jev等"System 1"快速决策模型的能力边界。实验发现,Jev开箱即退化为"跟随领先者"策略,无法识别序列中的交替规律,本质上只是在押注历史赢家。引入推理模型Luna虽能改善模式识别,却带来不可接受的延迟与成本代价。更具启发性的改进方案是将任务拆解:让模型只做逐动作的局部预测(Noul预测),再用argmin或softmin规则完成权重分配。这一分离使模型成功利用了序列结构,表现大幅提升。实验揭示,System 1模型的瓶颈不在于感知能力,而在于同时处理预测与分配时的相互干扰,针对性的训练环境设计可能是突破方向。
近期,一类被称为"System 1"的决策模型逐渐成为AI社区关注的焦点。继TypeSafe的Jev和开源权重的Laya模型之后,AWS Strands Decider、Cloudflare Clef以及OpenAI的Decisions API等新产品陆续登场。一位Reddit开发者分享了他在序贯决策基准测试中对Jev模型的实验,揭示了这类模型的能力边界与改进空间。
System 1 与 System 2:决策模型的认知框架
这个实验的理论出发点来自卡尼曼在《思考,快与慢》中提出的双系统理论。看一眼人脸就能瞬间识别其情绪,这是无需刻意思考的System 1反应;而计算17×24则需要调动费力的System 2深思。
实验者提出了一个有趣的类比:如果进化和社会条件让人类擅长读脸,那么为决策训练的机器也应该能精确地权衡选择——我们希望概率判断成为它们的"第一本能"。这正是Jev这类System 1决策模型想要实现的目标:快速、直觉式地输出决策概率,而非像推理模型那样进行冗长的链式思考。

不过,一个关键问题随之浮现:Jev的概率输出究竟在多大程度上依赖于描述任务和选项的具体文本?我们是否在无意中把人类文献的偏好"烘焙"进了决策模型?为了剥离文字包装、提取纯粹的决策权衡能力,实验者设计了一个在线学习游戏。
卡尼曼的双系统理论最初是认知心理学框架,近年来被AI研究者借用来区分两类截然不同的模型架构取向。在大语言模型语境下,System 2对应以OpenAI o系列、DeepSeek广告-R1为代表的"推理模型"——它们在输出答案前会生成大量内部思维链(chain-of-thought),通过显式的逐步推导来提高准确性,但每次调用往往需要数秒乃至数十秒,token消耗量也远高于普通模型。System 1模型则试图绕过这一过程,直接输出概率分布或决策权重,目标是在毫秒级延迟和极低成本下完成"够好"的判断。这种区分在实时竞价、推荐系统、自动化交易等对响应速度极度敏感的场景中具有重要意义——在这些场景里,一个慢但准确的答案往往还不如一个快而合理的近似解。
实验设计:四动作六十四轮的在线学习游戏
实验的核心设置相当精巧。游戏包含四个动作,总共64轮。在每次决策前,模型会看到每个动作的历史损失记录。Jev输出的选择概率被转化为分配权重,模型则承担这些权重的加权平均损失。
值得关注的是实验的约束条件:所有损失在游戏开始前就已固定,只是每轮逐一揭示。这意味着真正考验模型的,是它能否从已揭示的序列中识别规律并加以利用——即在线学习领域经典的"遗憾最小化"问题。
这种设计的巧妙之处在于,它把决策能力从具体的文本语境中抽离出来,只保留纯粹的数值权衡。如果模型只是在复述训练语料中的决策模式,那么在这个抽象的数字游戏中它将无所遁形。
遗憾最小化(regret minimization)是在线学习理论的核心概念。"遗憾"被定义为算法实际累积损失与事后最优固定策略损失之间的差值——即"如果我从一开始就知道哪个动作最好,我本可以少亏多少"。理论上,一个良好的在线学习算法应能保证遗憾随轮次增长的速度远低于线性,通常目标是O(√T)量级。经典算法如指数权重(Multiplicative Weights / Hedge)和UCB(Upper Confidence Bound)已被证明能在不同假设下达到这一保证。将这个框架引入对决策模型的评估,意味着我们不只是问模型"猜对了多少次",而是问它"与理论最优相比,浪费了多少潜在收益"——这是一个更严苛也更有区分度的衡量标准。
开箱表现:Jev退化为"跟随领先者"
实验结果并不理想。Jev在这个环境中表现不佳:它几乎把所有权重都压在历史表现最好的那个动作上,行为模式类似于经典的"跟随领先者"(Follow-the-Leader, FTL)策略。
FTL有其适用场景——当某个动作自始至终都是最优时,它表现良好。但面对简单的交替模式,这种策略就显得过于粗糙。当最优动作在不同轮次之间切换时,一味跟随历史赢家只会带来持续的损失。
这个结果印证了实验者的担忧:开箱即用的System 1决策模型,更像是在做一种直觉性的"押注历史赢家",而缺乏对序列模式的真正感知。它没有利用序列中隐藏的结构信息。
改进路径一:引入推理模型的代价
一个直接的改进思路是把问题塞进像Luna这样的推理模型里。在某些环境下,Luna确实表现好得多——它能够通过显式推理识别出序列中的模式。
但这里存在明显的权衡。Luna是一个典型的System 2模型,这意味着显著更高的延迟和成本。用重型推理模型去解决本该由轻量决策模型处理的问题,在实际部署中往往得不偿失。这也正是System 1模型存在价值的原因——我们需要的是快速、低成本的决策能力。
改进路径二:分离预测与分配
实验者提出的第二个方案更具启发性:让Jev只负责识别模式,而非直接做选择。
具体做法是,不再让模型在动作之间做选择,而是让它为每个动作单独预测——下一轮该动作是否会产生损失。这些预测被称为"Noul预测"。随后,实验者把这些预测转化为两种策略:
- argmin策略:把全部权重放在预测损失最小的动作上
- softmin策略:当多个预测结果接近时,在它们之间分散权重
结果发生了戏剧性的变化。Noul + argmin成功利用了完美的交替模式;而softmin则在排名不可靠时减少了损失。将"预测"与"分配"两个环节分离开来,带来了实质性的改进。
这个发现背后的洞见是:System 1模型并非不具备感知模式的能力,而是在同时处理"预测"和"决策分配"时表现糟糕。一旦把任务拆解,让模型专注于它擅长的局部预测,再用确定性规则完成分配,整体表现就显著提升。
这里的softmin策略在概念上与强化学习中的"探索-利用权衡"(exploration-exploitation tradeoff)密切相关。argmin策略是纯利用(exploitation)——始终选择当前预测最优的动作,在模式清晰时收益最大,但对预测误差极度敏感。softmin则通过在多个候选动作间分散权重,引入了一定程度的探索(exploration),代价是放弃部分潜在收益,换取对预测不确定性的鲁棒性。这种设计思路与Hedge算法的指数加权机制异曲同工:当证据不足以区分各选项时,保持分散;当某个选项的优势足够显著时,逐渐集中。将这一逻辑从算法层面迁移到"模型预测+确定性规则"的混合架构,正是本实验最具工程价值的发现。
对决策模型训练的启示
实验者由此得出一个乐观的结论:专为此类决策任务构建的训练环境,有望改进System 1模型的能力。
这个观点对当前涌现的一批决策API(如OpenAI的Decisions API、AWS Strands Decider等)具有参考价值。它暗示着,决策模型的进步可能不仅仅依赖于更大的参数规模或更强的推理能力,而在于训练环境和任务结构的设计——让模型学会在不借助重型推理的前提下,把概率权衡变成"第一本能"。
需要说明的是,本文基于单一来源的开发者实验,实验涉及的Jev、Laya、Luna、Noul等模型名称均来自原文描述。实验者已公开了相关代码(Google Colab),感兴趣的读者可自行复现验证。
结语
这项小规模实验虽然样本有限,但提供了一个有价值的视角:评估System 1决策模型,不能只看开箱表现,更要理解它在抽象决策任务中的失败模式。将预测与分配分离、针对性设计训练环境,可能是这类快速决策模型突破能力瓶颈的关键方向。
相关推荐

Claude Code创建者为何建议删除配置?上下文工程四大转变解析
Claude Code创建者Boris Cherny建议定期删除配置引发热议。本文拆解这句话的真正含义,解析上下文工程的四大转变:规则改判断标准、示例改接口、前置加载改渐进式披露、善用自动记忆与默认验证,帮你让AI配置与模型迭代并行。

推翻萨达姆只是开始:历史学家沙拉·佩恩拆解伊拉克困局
历史学家沙拉·佩恩深度解析伊拉克战争:推翻萨达姆容易,稳定难。从有限目标vs无限目标、马赛克社会、2000英里边境到邻国干预,拆解政权更迭的战略陷阱。

COLM会议期间如何像本地人一样体验旧金山
AI研究者Jason Wei发推为COLM会议参会者提供旧金山本地体验指南,提醒访客勿因会场周边街区而对这座城市产生片面印象,并分享像本地人一样探索旧金山的建议。