Benchmark
Artificial Analysis
Artificial Analysis是一个独立的AI模型评测与比较平台,专注于对大型语言模型及其他AI模型进行多维度基准测试,涵盖模型能力(Intelligence Index智能指数)、推理速度、价格及可用性等指标。平台以独立、客观为原则,汇聚多项标准化测试结果,为研究人员、开发者和企业提供跨模型的横向比较参考。
Core Facts
Timeline (last 90 days)
Jun 3
Artificial Analysis是一个独立的AI模型基准测试平台,综合编程能力、数学推理、语言理解、知识问答等多个维度评估模型表现
Verified70%
Jun 1
在Artificial Analysis第三方评测的编码指数(推理模式)上,GPT-5 Mini High的得分比Haiku 4.5高出9个点
Unverified80%
May 31
Artificial Analysis的编码智能体指数中,Composer 2在Cursor Client中得分48,Composer 2.5得分63
Unverified85%
May 31
Gemini 3.5 Flash的生成速度接近300 token/秒
Verified90%
May 31
阶跃星辰开源语言模型Step-2-DOR 1.1在Artificial Analysis Speech Reasoning排行榜中排名全球第一,准确率为96.4%
Unverified85%
May 31
MiniMax M2模型在Artificial Analysis榜单上已进入全球前五
Expired60%