CLM
基于Qwen3-8B构建的开源决策验证模型,通过轻量级投影头(约75MB)实现结构化判断,支持Choice/Noul/Score三种决策原语,可自托管部署,兼容TypeSafe Jev接口
时间轴 (近 90 天)
CLM(对比语言模型)采用对比学习目标连接「状态」与「动作」,被定位为超快的「系统一」模型
对比学习驱动的 CLM(Contrastive Language Model)发布,CLM 8B 推理速度最高可达同类的 9 倍
CLM声称提供Jev的完整原语集而非子集,原本为Jev客户端编写的代码可通过指向clm-serve端点实现无缝drop-in替换
CLM将状态头与动作头拆开处理,对于固定动作空间的Agent只需将动作嵌入一次并缓存复用,而Jev将状态与问题候选联合评估
在交互式浏览器Agent及游戏场景(如T-Rex、Super Mario)的基准测试中,CLM的速度达到Jev的4至13倍
CLM的投影头是开放权重,用户可基于自己的Agent轨迹进行微调,而Jev是封闭API无法微调
经过Agent轨迹微调后,CLM在Terminal-Bench 2.1上达到87.6%,在DeepSWE上达到81.6%
零样本的Jev在DeepSWE基准上表现约71%,低于微调后的CLM的81.6%
在Berkeley Function Calling Leaderboard v4上,Jev得分99.2%,CLM-8B为95.2%
在WikiRacing任务上,Jev得分30/30满分,CLM-8B为26/30
还有 17 条时间轴事件
全部知识事实 (20)
CLM(对比语言模型)采用对比学习目标连接「状态」与「动作」,被定位为超快的「系统一」模型
50%待验证CLM声称提供Jev的完整原语集而非子集,原本为Jev客户端编写的代码可通过指向clm-serve端点实现无缝drop-in替换
50%待验证CLM复刻了Jev的"System One"决策接口,支持三种核心问题原语:Choice(返回类别概率分布)、Noul(输出校准的真/假概率)、Score(按评分标准打分)
50%待验证CLM将状态头与动作头拆开处理,对于固定动作空间的Agent只需将动作嵌入一次并缓存复用,而Jev将状态与问题候选联合评估
50%待验证在交互式浏览器Agent及游戏场景(如T-Rex、Super Mario)的基准测试中,CLM的速度达到Jev的4至13倍
50%待验证CLM的投影头是开放权重,用户可基于自己的Agent轨迹进行微调,而Jev是封闭API无法微调
50%待验证经过Agent轨迹微调后,CLM在Terminal-Bench 2.1上达到87.6%,在DeepSWE上达到81.6%
50%待验证零样本的Jev在DeepSWE基准上表现约71%,低于微调后的CLM的81.6%
50%待验证在Berkeley Function Calling Leaderboard v4上,Jev得分99.2%,CLM-8B为95.2%
50%待验证在WikiRacing任务上,Jev得分30/30满分,CLM-8B为26/30
50%待验证Jev开箱即支持最高64K token上下文,而CLM-8B仅在2K到8K上下文范围内经过测试和校准,超过8K后的表示尚未针对参考头校准
50%待验证CLM通过点积加softmax在请求传入的候选集上计算概率,因此其概率是相对于所提供候选集的相对值,只能用于同一请求内的候选排序而不能跨请求绝对比较
50%待验证对于动作空间固定、调用频繁且能提供领域微调数据的Agent系统(如浏览器自动化、编码验证),CLM是极具吸引力的自托管选择;而需要广域知识、长上下文和绝对概率校准的通用场景更适合Jev
50%待验证文中基准结果来自Reddit社区单一讨论帖及项目自述数据,尚未经过独立第三方复现
50%待验证CLM是基于Qwen3-8B主干构建的一组轻量级投影头,总大小约75MB,定位为闭源模型Jev的开放权重、可本地部署替代方案
50%待验证CLM的技能图谱将可复用的策略、角色、异议处理和目标进行类型化和组合化管理,每个元素都是可组合的模块
50%待验证CLM的活体数字孪生为企业各职能领域构建具备推理能力的数字代理,可作为推理替身参与决策模拟
50%待验证CLM的深度安全层内置全流程安全治理机制,满足LGPD等法规要求
50%待验证CLM引入了Spec-as-Code(规范即代码)范式,将治理良好的意图表达直接转化为可执行、可审计的系统行为
50%待验证论文提出了智慧监听者效应(Wisdom Listener Effect)概念,描述具备隐性知识捕获能力的基础模型随使用产生复合价值增长
50%