[控场AI]
基准

Cursor Bench

Cursor Bench是一个专门用于评估大型语言模型编码能力的基准测试工具,由Cursor团队开发和维护。该基准通过设计一系列真实的编程任务和代码生成场景,系统性地衡量模型在代码理解、生成、调试及补全等方面的综合表现,常用于比较不同AI模型在实际软件开发场景下的能力差异。

时间轴 (近 90 天)

10月2日

在Cursor Bench上Sonnet 5.5单任务消耗271,920个token,超过Opus的218k和Gemini 3.8 Flash的162k

待验证50%
10月1日

在Cursor Bench上Sonnet 5.5每个任务消耗271,920个token,超过Opus的约218k,约为Gemini 3 Flash的两倍

待验证50%
9月30日

在 Cursor Bench 上,Sonnet 5.5 的最好成绩与 Opus 5.5 只差两分左右

待验证50%

全部知识事实 (3)

来源文章