[控场AI]
基准

Artificial Analysis

Artificial Analysis是一个独立的AI模型评测与比较平台,专注于对大型语言模型及其他AI模型进行多维度基准测试,涵盖模型能力(Intelligence Index智能指数)、推理速度、价格及可用性等指标。平台以独立、客观为原则,汇聚多项标准化测试结果,为研究人员、开发者和企业提供跨模型的横向比较参考。

核心事实

时间轴 (近 90 天)

10月4日

根据Artificial Analysis智能指数,MiMo Pro是当前最强的开源模型,仅次于最高设置下的GPT-5.6 Sol

待验证50%
10月4日

Astra在Artificial Analysis智能指数上低于GLM 5.3 Flash等小模型,因该指数基于已过时饱和的基准(如GPQA)

待验证50%
10月3日

Artificial Analysis将Argon在同价位223个模型的指数中排在第八

待验证50%
10月1日

根据Artificial Analysis的数据,从Opus 5到Opus 5.5每个任务的推理token数从约4.2万翻倍增至8.4万,而输出token仅从3万增至3.5万

待验证50%
9月30日

性价比曲线通常以MMLU、MATH、HumanEval等基准得分为纵轴、每百万token成本为横轴,是Artificial Analysis、LMSys等第三方评测平台常用的可视化工具

待验证50%
9月30日

在Artificial Analysis综合智能指数中,GPT-6 Sol满档48分(与Astra同档),Luna满档36分

待验证50%
9月30日

Artificial Analysis发布Cyber Index基准衡量AI模型网络防御能力,Grok 4.7与MIMO V2.6 Pro以56分并列最高

待验证50%
9月29日

在Artificial Analysis综合指数中,Opus 5.5得58分,Sol得48分,Luna得37分

待验证50%
9月29日

Opus 5.5在终端智能体基准拿到66分,高于Sonnet的55分和Astra的57.9分

部分验证65%
9月28日

ElevenLabs 推出全新的 v4 语音合成模型

待验证50%

还有 40 条时间轴事件

全部知识事实 (20)

已验证

本文基于Reddit上的一则讨论帖整理,部分诉讼细节和数据来自单一来源尚待权威媒体核实

90%
已验证

Artificial Analysis是将模型智能程度与运行成本放在同一坐标系可视化比较的第三方评测平台

85%
已验证

当多个独立评测来源得出一致结论时,其可信度才更高,应交叉验证多个评测来源

75%
已验证

Artificial Analysis是一家成立于2023年的独立AI模型评测机构,总部位于伦敦

75%
已验证

Artificial Analysis Intelligence Index 通过综合推理、编码、数学、知识问答等多项评测给出统一智能评分

75%
已验证

MiMo V2.6 Pro在Artificial Analysis综合智能榜上拿下46分,与Grok 4.7并列第六、第七位

70%
已验证

Artificial Analysis是一个独立的AI模型基准测试平台,综合编程能力、数学推理、语言理解、知识问答等多个维度评估模型表现

70%
已验证

Artificial Analysis Intelligence Index整合了MMLU、HumanEval、MATH、GPQA等多个基准测试的加权结果

65%
已验证

Sonnet 5 的 Intelligence Index 比 Sonnet 4.6 高出 6 分,在代理知识工作任务上超过了 Opus 4.8

65%
已验证

按标准价格(3美元/15美元)计算,Sonnet 5 在 Intelligence Index 上平均每任务成本 2.29 美元,而 Opus 4.8 只要 1.99 美元,Sonnet 5 反而比 Opus 4.8 贵约 15%

65%
已验证

为关键任务建立对AI输出质量的持续监控并保留不同版本模型的对比能力有助于及时发现潜在退化问题

65%
待验证

综合智能指数AA由独立评测机构Artificial Analysis发布,汇总MMLU、GPQA、HumanEval、MATH等基准,计算0-100的综合分数

70%
待验证

GLM-5.3-Flash在Artificial Analysis综合智能指数评测中取得57分,与Claude Opus 4.8持平

70%
部分验证

Opus 5.5在终端智能体基准拿到66分,高于Sonnet的55分和Astra的57.9分

65%
待验证

在Artificial Analysis同轮评测中 Qwen 3.8 生成约1.6亿Token,而同级开放模型中位数为4300万Token

60%
待验证

Artificial Analysis 采用统一、受控的测试环境对模型进行多维度评估,其综合评分将推理、数学、代码、知识问答等维度通过加权算法汇总

60%
待验证

根据Artificial Analysis智能指数,MiMo Pro是当前最强的开源模型,仅次于最高设置下的GPT-5.6 Sol

50%
待验证

Astra在Artificial Analysis智能指数上低于GLM 5.3 Flash等小模型,因该指数基于已过时饱和的基准(如GPQA)

50%
待验证

Artificial Analysis将Argon在同价位223个模型的指数中排在第八

50%
待验证

根据Artificial Analysis的数据,从Opus 5到Opus 5.5每个任务的推理token数从约4.2万翻倍增至8.4万,而输出token仅从3万增至3.5万

50%

来源文章