[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
基准
SWE-Marathon
面向编码智能体的长会话基准测试,用于评估AI在软件工程任务中的持续执行能力
时间轴 (近 90 天)
10月1日
TomasuLLM在SWE-Marathon的18个会话上实现1.27倍的匹配进度提升
待验证
50%
全部知识事实 (1)
待验证
TomasuLLM在SWE-Marathon的18个会话上实现1.27倍的匹配进度提升
50%
来源文章
TomasuLLM:用乱序推测执行给LLM智能体提速
10月1日