[控场AI]
基准AI分析智能指数 / Intelligence Index

Artificial Analysis Intelligence Index

由Artificial Analysis平台发布的综合AI模型智能评分指数,整合MMLU、HumanEval、MATH、GPQA等多个权威基准测试的加权结果,评估模型推理、编码、数学、知识问答等综合能力

时间轴 (近 90 天)

9月14日

K2 Horizon 7B 在 Artificial Analysis Intelligence Index 上取得了介于 Qwen 3.6 27B 和 Qwen 3.6 35BA3b 之间的成绩

待验证50%
9月11日

Artificial Analysis Intelligence Index发布了v4.2版本

待验证50%
9月11日

未来版本可能会引入针对多模态能力、长上下文处理、特定领域任务的专项测试

待验证50%
9月11日

如何在评测体系中公平对比商业闭源模型和开源模型将成为这类指数需要解决的课题

待验证50%
7月21日

Artificial Analysis Intelligence Index 通过综合推理、编码、数学、知识问答等多项评测给出统一智能评分

待验证50%
7月13日

基准测试成绩与用户真实体验之间存在鸿沟,部分厂商存在针对特定基准专项优化(刷榜)以及训练数据污染导致成绩虚高的现象

待验证50%
7月2日

GLM 5.2在Artificial Analysis Intelligence Index上,MAX版本得分51分,是目前得分最高的开源权重模型

待验证50%

全部知识事实 (7)

来源文章