[控场AI]
模型Contrastive Language Models / CLM-v0.1-8B

CLM

基于Qwen3-8B构建的开源决策验证模型,通过轻量级投影头(约75MB)实现结构化判断,支持Choice/Noul/Score三种决策原语,可自托管部署,兼容TypeSafe Jev接口

时间轴 (近 90 天)

9月30日

CLM(对比语言模型)采用对比学习目标连接「状态」与「动作」,被定位为超快的「系统一」模型

待验证50%
9月30日

对比学习驱动的 CLM(Contrastive Language Model)发布,CLM 8B 推理速度最高可达同类的 9 倍

待验证50%
9月24日

CLM声称提供Jev的完整原语集而非子集,原本为Jev客户端编写的代码可通过指向clm-serve端点实现无缝drop-in替换

待验证50%
9月24日

CLM将状态头与动作头拆开处理,对于固定动作空间的Agent只需将动作嵌入一次并缓存复用,而Jev将状态与问题候选联合评估

待验证50%
9月24日

在交互式浏览器Agent及游戏场景(如T-Rex、Super Mario)的基准测试中,CLM的速度达到Jev的4至13倍

待验证50%
9月24日

CLM的投影头是开放权重,用户可基于自己的Agent轨迹进行微调,而Jev是封闭API无法微调

待验证50%
9月24日

经过Agent轨迹微调后,CLM在Terminal-Bench 2.1上达到87.6%,在DeepSWE上达到81.6%

待验证50%
9月24日

零样本的Jev在DeepSWE基准上表现约71%,低于微调后的CLM的81.6%

待验证50%
9月24日

在Berkeley Function Calling Leaderboard v4上,Jev得分99.2%,CLM-8B为95.2%

待验证50%
9月24日

在WikiRacing任务上,Jev得分30/30满分,CLM-8B为26/30

待验证50%

还有 17 条时间轴事件

全部知识事实 (20)

待验证

CLM(对比语言模型)采用对比学习目标连接「状态」与「动作」,被定位为超快的「系统一」模型

50%
待验证

CLM声称提供Jev的完整原语集而非子集,原本为Jev客户端编写的代码可通过指向clm-serve端点实现无缝drop-in替换

50%
待验证

CLM复刻了Jev的"System One"决策接口,支持三种核心问题原语:Choice(返回类别概率分布)、Noul(输出校准的真/假概率)、Score(按评分标准打分)

50%
待验证

CLM将状态头与动作头拆开处理,对于固定动作空间的Agent只需将动作嵌入一次并缓存复用,而Jev将状态与问题候选联合评估

50%
待验证

在交互式浏览器Agent及游戏场景(如T-Rex、Super Mario)的基准测试中,CLM的速度达到Jev的4至13倍

50%
待验证

CLM的投影头是开放权重,用户可基于自己的Agent轨迹进行微调,而Jev是封闭API无法微调

50%
待验证

经过Agent轨迹微调后,CLM在Terminal-Bench 2.1上达到87.6%,在DeepSWE上达到81.6%

50%
待验证

零样本的Jev在DeepSWE基准上表现约71%,低于微调后的CLM的81.6%

50%
待验证

在Berkeley Function Calling Leaderboard v4上,Jev得分99.2%,CLM-8B为95.2%

50%
待验证

在WikiRacing任务上,Jev得分30/30满分,CLM-8B为26/30

50%
待验证

Jev开箱即支持最高64K token上下文,而CLM-8B仅在2K到8K上下文范围内经过测试和校准,超过8K后的表示尚未针对参考头校准

50%
待验证

CLM通过点积加softmax在请求传入的候选集上计算概率,因此其概率是相对于所提供候选集的相对值,只能用于同一请求内的候选排序而不能跨请求绝对比较

50%
待验证

对于动作空间固定、调用频繁且能提供领域微调数据的Agent系统(如浏览器自动化、编码验证),CLM是极具吸引力的自托管选择;而需要广域知识、长上下文和绝对概率校准的通用场景更适合Jev

50%
待验证

文中基准结果来自Reddit社区单一讨论帖及项目自述数据,尚未经过独立第三方复现

50%
待验证

CLM是基于Qwen3-8B主干构建的一组轻量级投影头,总大小约75MB,定位为闭源模型Jev的开放权重、可本地部署替代方案

50%
待验证

CLM的技能图谱将可复用的策略、角色、异议处理和目标进行类型化和组合化管理,每个元素都是可组合的模块

50%
待验证

CLM的活体数字孪生为企业各职能领域构建具备推理能力的数字代理,可作为推理替身参与决策模拟

50%
待验证

CLM的深度安全层内置全流程安全治理机制,满足LGPD等法规要求

50%
待验证

CLM引入了Spec-as-Code(规范即代码)范式,将治理良好的意图表达直接转化为可执行、可审计的系统行为

50%
待验证

论文提出了智慧监听者效应(Wisdom Listener Effect)概念,描述具备隐性知识捕获能力的基础模型随使用产生复合价值增长

50%

来源文章