[控场AI]
基准

JevBench

用于评估System One类推理模型性能的基准测试,衡量大型语言模型推理与规划能力

时间轴 (近 90 天)

10月3日

Winnow 是 JevBench 基准测试中排名第一的开源 System One 模型

待验证50%
9月22日

已出现名为 JevBench 的基准测试,专门用于比较 Jev 级决策模型

待验证50%

全部知识事实 (2)

来源文章