[KongchangAI]
Benchmark

EvoArena

新加坡国立大学提出的AI智能体评测基准,专注于评估智能体在动态演变环境中的持续适应能力,包含Terminal、SWE和个性化对话三大场景

Timeline (last 90 days)

Sep 16

EvoArena由新加坡国立大学博士生徐迅东团队提出,用于评估AI智能体在动态变化环境中的持续适应能力

Unverified50%
Sep 16

智能体的行为是模型、工具、记忆与环境状态共同作用的结果,即便模型、工具、记忆和任务指令都不变,环境改变也会导致行为变化

Unverified50%
Sep 16

EvoArena关注的是环境演变(Environment Evolution),区别于动态生成任务(Dynamic Task)和智能体自进化(Agent Evolution)

Unverified50%
Sep 16

EvoArena构建了三类动态环境场景:Terminal-Bench Evolve(工作流场景)、SWE-Chain Evolve(软件工程场景)、Persona-Mem Evolve(社会智能场景)

Unverified50%
Sep 16

在EvoArena测试中,Step Level最高的GPT-5.5只有50%出头的准确率,Chain Level表现最好的Gemini-3.1 Pro和GLM-5.1也只有约28%-29%

Unverified50%

All Facts (5)

Source Articles