Artificial Analysis Intelligence Index
由Artificial Analysis平台发布的综合AI模型智能评分指数,整合MMLU、HumanEval、MATH、GPQA等多个权威基准测试的加权结果,评估模型推理、编码、数学、知识问答等综合能力
Timeline (last 90 days)
K2 Horizon 7B 在 Artificial Analysis Intelligence Index 上取得了介于 Qwen 3.6 27B 和 Qwen 3.6 35BA3b 之间的成绩
Artificial Analysis Intelligence Index发布了v4.2版本
未来版本可能会引入针对多模态能力、长上下文处理、特定领域任务的专项测试
如何在评测体系中公平对比商业闭源模型和开源模型将成为这类指数需要解决的课题
Artificial Analysis Intelligence Index 通过综合推理、编码、数学、知识问答等多项评测给出统一智能评分
基准测试成绩与用户真实体验之间存在鸿沟,部分厂商存在针对特定基准专项优化(刷榜)以及训练数据污染导致成绩虚高的现象
GLM 5.2在Artificial Analysis Intelligence Index上,MAX版本得分51分,是目前得分最高的开源权重模型
All Facts (7)
K2 Horizon 7B 在 Artificial Analysis Intelligence Index 上取得了介于 Qwen 3.6 27B 和 Qwen 3.6 35BA3b 之间的成绩
50%UnverifiedArtificial Analysis Intelligence Index 通过综合推理、编码、数学、知识问答等多项评测给出统一智能评分
50%Unverified基准测试成绩与用户真实体验之间存在鸿沟,部分厂商存在针对特定基准专项优化(刷榜)以及训练数据污染导致成绩虚高的现象
50%UnverifiedGLM 5.2在Artificial Analysis Intelligence Index上,MAX版本得分51分,是目前得分最高的开源权重模型
50%UnverifiedArtificial Analysis Intelligence Index发布了v4.2版本
50%Unverified未来版本可能会引入针对多模态能力、长上下文处理、特定领域任务的专项测试
50%Unverified如何在评测体系中公平对比商业闭源模型和开源模型将成为这类指数需要解决的课题
50%