[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
基准
SWE-Lancer
用于评估大语言模型编程能力的基准测试,包含task selection和per-task两种评估模式,测试模型解决真实软件工程任务的能力
来源文章
Kimi K3模型从711GB压缩至478GB:移除多语言层的定向瘦身实验
9月12日