EvoArena
新加坡国立大学提出的AI智能体评测基准,专注于评估智能体在动态演变环境中的持续适应能力,包含Terminal、SWE和个性化对话三大场景
时间轴 (近 90 天)
EvoArena由新加坡国立大学博士生徐迅东团队提出,用于评估AI智能体在动态变化环境中的持续适应能力
智能体的行为是模型、工具、记忆与环境状态共同作用的结果,即便模型、工具、记忆和任务指令都不变,环境改变也会导致行为变化
EvoArena关注的是环境演变(Environment Evolution),区别于动态生成任务(Dynamic Task)和智能体自进化(Agent Evolution)
EvoArena构建了三类动态环境场景:Terminal-Bench Evolve(工作流场景)、SWE-Chain Evolve(软件工程场景)、Persona-Mem Evolve(社会智能场景)
在EvoArena测试中,Step Level最高的GPT-5.5只有50%出头的准确率,Chain Level表现最好的Gemini-3.1 Pro和GLM-5.1也只有约28%-29%
全部知识事实 (5)
EvoArena由新加坡国立大学博士生徐迅东团队提出,用于评估AI智能体在动态变化环境中的持续适应能力
50%待验证智能体的行为是模型、工具、记忆与环境状态共同作用的结果,即便模型、工具、记忆和任务指令都不变,环境改变也会导致行为变化
50%待验证EvoArena关注的是环境演变(Environment Evolution),区别于动态生成任务(Dynamic Task)和智能体自进化(Agent Evolution)
50%待验证EvoArena构建了三类动态环境场景:Terminal-Bench Evolve(工作流场景)、SWE-Chain Evolve(软件工程场景)、Persona-Mem Evolve(社会智能场景)
50%待验证在EvoArena测试中,Step Level最高的GPT-5.5只有50%出头的准确率,Chain Level表现最好的Gemini-3.1 Pro和GLM-5.1也只有约28%-29%
50%