Artificial Analysis
Artificial Analysis是一个独立的AI模型评测与比较平台,专注于对大型语言模型及其他AI模型进行多维度基准测试,涵盖模型能力(Intelligence Index智能指数)、推理速度、价格及可用性等指标。平台以独立、客观为原则,汇聚多项标准化测试结果,为研究人员、开发者和企业提供跨模型的横向比较参考。
核心事实
时间轴 (近 90 天)
根据Artificial Analysis智能指数,MiMo Pro是当前最强的开源模型,仅次于最高设置下的GPT-5.6 Sol
Astra在Artificial Analysis智能指数上低于GLM 5.3 Flash等小模型,因该指数基于已过时饱和的基准(如GPQA)
Artificial Analysis将Argon在同价位223个模型的指数中排在第八
根据Artificial Analysis的数据,从Opus 5到Opus 5.5每个任务的推理token数从约4.2万翻倍增至8.4万,而输出token仅从3万增至3.5万
性价比曲线通常以MMLU、MATH、HumanEval等基准得分为纵轴、每百万token成本为横轴,是Artificial Analysis、LMSys等第三方评测平台常用的可视化工具
在Artificial Analysis综合智能指数中,GPT-6 Sol满档48分(与Astra同档),Luna满档36分
Artificial Analysis发布Cyber Index基准衡量AI模型网络防御能力,Grok 4.7与MIMO V2.6 Pro以56分并列最高
在Artificial Analysis综合指数中,Opus 5.5得58分,Sol得48分,Luna得37分
Opus 5.5在终端智能体基准拿到66分,高于Sonnet的55分和Astra的57.9分
ElevenLabs 推出全新的 v4 语音合成模型
还有 40 条时间轴事件
全部知识事实 (20)
本文基于Reddit上的一则讨论帖整理,部分诉讼细节和数据来自单一来源尚待权威媒体核实
90%已验证Artificial Analysis是将模型智能程度与运行成本放在同一坐标系可视化比较的第三方评测平台
85%已验证当多个独立评测来源得出一致结论时,其可信度才更高,应交叉验证多个评测来源
75%已验证Artificial Analysis是一家成立于2023年的独立AI模型评测机构,总部位于伦敦
75%已验证Artificial Analysis Intelligence Index 通过综合推理、编码、数学、知识问答等多项评测给出统一智能评分
75%已验证MiMo V2.6 Pro在Artificial Analysis综合智能榜上拿下46分,与Grok 4.7并列第六、第七位
70%已验证Artificial Analysis是一个独立的AI模型基准测试平台,综合编程能力、数学推理、语言理解、知识问答等多个维度评估模型表现
70%已验证Artificial Analysis Intelligence Index整合了MMLU、HumanEval、MATH、GPQA等多个基准测试的加权结果
65%已验证Sonnet 5 的 Intelligence Index 比 Sonnet 4.6 高出 6 分,在代理知识工作任务上超过了 Opus 4.8
65%已验证按标准价格(3美元/15美元)计算,Sonnet 5 在 Intelligence Index 上平均每任务成本 2.29 美元,而 Opus 4.8 只要 1.99 美元,Sonnet 5 反而比 Opus 4.8 贵约 15%
65%已验证为关键任务建立对AI输出质量的持续监控并保留不同版本模型的对比能力有助于及时发现潜在退化问题
65%待验证综合智能指数AA由独立评测机构Artificial Analysis发布,汇总MMLU、GPQA、HumanEval、MATH等基准,计算0-100的综合分数
70%待验证GLM-5.3-Flash在Artificial Analysis综合智能指数评测中取得57分,与Claude Opus 4.8持平
70%部分验证Opus 5.5在终端智能体基准拿到66分,高于Sonnet的55分和Astra的57.9分
65%待验证在Artificial Analysis同轮评测中 Qwen 3.8 生成约1.6亿Token,而同级开放模型中位数为4300万Token
60%待验证Artificial Analysis 采用统一、受控的测试环境对模型进行多维度评估,其综合评分将推理、数学、代码、知识问答等维度通过加权算法汇总
60%待验证根据Artificial Analysis智能指数,MiMo Pro是当前最强的开源模型,仅次于最高设置下的GPT-5.6 Sol
50%待验证Astra在Artificial Analysis智能指数上低于GLM 5.3 Flash等小模型,因该指数基于已过时饱和的基准(如GPQA)
50%待验证Artificial Analysis将Argon在同价位223个模型的指数中排在第八
50%待验证根据Artificial Analysis的数据,从Opus 5到Opus 5.5每个任务的推理token数从约4.2万翻倍增至8.4万,而输出token仅从3万增至3.5万
50%