Benchmark
SWE-Lancer
用于评估大语言模型编程能力的基准测试,包含task selection和per-task两种评估模式,测试模型解决真实软件工程任务的能力
Timeline (last 90 days)
Sep 11
测试者使用SWE-Lancer基准的task selection和per-task两种模式评估模型编程能力
Unverified50%
Sep 11
标准的Kimi-K3-REAP-512GB版本在SWE-Lancer任务14294、15815_1、15925上完全失败
Unverified50%
Sep 11
reap576_iq2xxs(478GB)版本成功解决了SWE-Lancer任务14294、15815_1、15925
Unverified50%
Sep 11
流式解码速度较慢,平均每个SWE-Lancer任务耗时约2.5小时
Unverified50%
Sep 11
通过RunPod租用云端算力跑完全部SWE-Lancer任务的预估费用高达1800美元
Expired50%