[KongchangAI]
Benchmark

SWE-Lancer

用于评估大语言模型编程能力的基准测试,包含task selection和per-task两种评估模式,测试模型解决真实软件工程任务的能力

Timeline (last 90 days)

Sep 11

测试者使用SWE-Lancer基准的task selection和per-task两种模式评估模型编程能力

Unverified50%
Sep 11

标准的Kimi-K3-REAP-512GB版本在SWE-Lancer任务14294、15815_1、15925上完全失败

Unverified50%
Sep 11

reap576_iq2xxs(478GB)版本成功解决了SWE-Lancer任务14294、15815_1、15925

Unverified50%
Sep 11

流式解码速度较慢,平均每个SWE-Lancer任务耗时约2.5小时

Unverified50%
Sep 11

通过RunPod租用云端算力跑完全部SWE-Lancer任务的预估费用高达1800美元

Expired50%

All Facts (4)

Source Articles