[控场AI]
基准AI分析智能指数 / Intelligence Index

Artificial Analysis Intelligence Index

由Artificial Analysis平台发布的综合AI模型智能评分指数,整合MMLU、HumanEval、MATH、GPQA等多个权威基准测试的加权结果,评估模型推理、编码、数学、知识问答等综合能力

核心事实

时间轴 (近 90 天)

10月4日

韩国AI初创公司Motif以30人团队、使用不到1000张GPU,训练出在Artificial Analysis Intelligence Index开源模型榜单上跻身前五的模型

待验证50%
9月14日

K2 Horizon 7B 在 Artificial Analysis Intelligence Index 上取得了介于 Qwen 3.6 27B 和 Qwen 3.6 35BA3b 之间的成绩

已过期50%
9月11日

未来版本可能会引入针对多模态能力、长上下文处理、特定领域任务的专项测试

待验证50%
9月11日

Artificial Analysis Intelligence Index发布了v4.2版本

待验证60%
9月11日

如何在评测体系中公平对比商业闭源模型和开源模型将成为这类指数需要解决的课题

待验证50%
9月5日

综合智能指数AA由独立评测机构Artificial Analysis发布,汇总MMLU、GPQA、HumanEval、MATH等基准,计算0-100的综合分数

待验证70%
7月21日

Artificial Analysis Intelligence Index 通过综合推理、编码、数学、知识问答等多项评测给出统一智能评分

已验证75%
7月13日

基准测试成绩与用户真实体验之间存在鸿沟,部分厂商存在针对特定基准专项优化(刷榜)以及训练数据污染导致成绩虚高的现象

待验证50%

全部知识事实 (7)

来源文章