[KongchangAI]
BenchmarkAI分析智能指数 / Intelligence Index

Artificial Analysis Intelligence Index

由Artificial Analysis平台发布的综合AI模型智能评分指数,整合MMLU、HumanEval、MATH、GPQA等多个权威基准测试的加权结果,评估模型推理、编码、数学、知识问答等综合能力

Timeline (last 90 days)

Sep 14

K2 Horizon 7B 在 Artificial Analysis Intelligence Index 上取得了介于 Qwen 3.6 27B 和 Qwen 3.6 35BA3b 之间的成绩

Unverified50%
Sep 11

Artificial Analysis Intelligence Index发布了v4.2版本

Unverified50%
Sep 11

未来版本可能会引入针对多模态能力、长上下文处理、特定领域任务的专项测试

Unverified50%
Sep 11

如何在评测体系中公平对比商业闭源模型和开源模型将成为这类指数需要解决的课题

Unverified50%
Jul 21

Artificial Analysis Intelligence Index 通过综合推理、编码、数学、知识问答等多项评测给出统一智能评分

Unverified50%
Jul 13

基准测试成绩与用户真实体验之间存在鸿沟,部分厂商存在针对特定基准专项优化(刷榜)以及训练数据污染导致成绩虚高的现象

Unverified50%
Jul 2

GLM 5.2在Artificial Analysis Intelligence Index上,MAX版本得分51分,是目前得分最高的开源权重模型

Unverified50%

All Facts (7)

Source Articles