基准Emerging Capabilities Index / 新兴能力指数
ECI
Epoch AI推出的综合评测基准,衡量前沿大模型在复杂推理、编程、数学和科学任务上的综合能力,旨在反映模型在接近人类专家水平任务上的表现
时间轴 (近 90 天)
10月5日
Anthropic发布的Claude Opus 5.5在Epoch AI的ECI评测中获得167分,位列全球第一
待验证50%
9月4日
部分前沿模型的cyber-ECI比其通用ECI高出超过10个点
已过期50%
9月4日
ECI(Effective Capability Index,等效能力指数)是一种将模型能力换算成时间进度的方法,其设计思路借鉴了经济学中购买力平价的理念
待验证50%
9月4日
ECI旨在解决传统基准测试(如MMLU、HumanEval等)各自为政、难以横向比较的问题,回答模型能力相当于什么时间节点技术水平的问题
待验证50%
9月4日
AI能力的典型进步节奏约为每年15.5个ECI点,这是基于过去数年主流模型在多个基准上综合表现回归得出的经验值
待验证50%