[控场AI]
基准

SWE-Marathon

面向编码智能体的长会话基准测试,用于评估AI在软件工程任务中的持续执行能力

时间轴 (近 90 天)

10月1日

TomasuLLM在SWE-Marathon的18个会话上实现1.27倍的匹配进度提升

待验证50%

全部知识事实 (1)

来源文章