[控场AI]
基准

EvoArena

新加坡国立大学提出的AI智能体评测基准,专注于评估智能体在动态演变环境中的持续适应能力,包含Terminal、SWE和个性化对话三大场景

时间轴 (近 90 天)

9月16日

EvoArena由新加坡国立大学博士生徐迅东团队提出,用于评估AI智能体在动态变化环境中的持续适应能力

待验证50%
9月16日

智能体的行为是模型、工具、记忆与环境状态共同作用的结果,即便模型、工具、记忆和任务指令都不变,环境改变也会导致行为变化

待验证50%
9月16日

EvoArena关注的是环境演变(Environment Evolution),区别于动态生成任务(Dynamic Task)和智能体自进化(Agent Evolution)

待验证50%
9月16日

EvoArena构建了三类动态环境场景:Terminal-Bench Evolve(工作流场景)、SWE-Chain Evolve(软件工程场景)、Persona-Mem Evolve(社会智能场景)

待验证50%
9月16日

在EvoArena测试中,Step Level最高的GPT-5.5只有50%出头的准确率,Chain Level表现最好的Gemini-3.1 Pro和GLM-5.1也只有约28%-29%

待验证50%

全部知识事实 (5)

来源文章